dimhold.by
← Артыкулы

9 мадэляў, accuracy ад 92.5 да 93.3, і адна з іх не знаходзіць нічога

Нехта паказвае мадэль з accuracy 93 адсоткі, і зала ківае. Я ў гэтай зале сядзеў і ківаў. Вось што трэба было пытаць замест гэтага.

Задача сапраўдная і дастаткова малая, каб праверыць рукамі. Бяром рэпазіторый, становімся на першае чысло месяца і па кожным файле прадказваем, ці кране яго хтосьці ў найбліжэйшыя 7 дзён. Прыкметы толькі з мінулага: колькі разоў файл мяняўся за папярэднія 180 дзён, колькі дзён прайшло з апошняй праўкі, якога ён памеру. Навучанне ідзе па месяцах да ліпеня 2013, праверка па ўсім, што пасля, таму свайго будучага мадэль не бачыць. Класіфікатар гэта лагістычная рэгрэсія, напісаная рукамі: 3 прыкметы, градыентны спуск. Справа тут не ў мадэлі.

Станоўчых у праверцы 6.8 адсотка. Значыць адказ “ніколі” на ўсё запар дае accuracy 93.2 адсотка, і гэта той лік, які трэба пабіць.

адна мадэль на 9 парогах, адсоткі 0 50 100 адказ "ніколі": 93.2 accuracy: ад 92.5 да 93.3, усе 9 19.6 0.6 паўната, доля знойдзеных сапраўдных правак 0.1 0.3 0.5 0.7 0.9 парог
Accuracy ўкладваецца ў 0.8 пункта на ўсім разбегу. Паўната мяняецца ў 32 разы. Справаздача, якая нясе першы лік, не нясе ніякай інфармацыі пра тое, якую з гэтых 9 мадэляў выкацілі.

Найлепшая accuracy на разбегу гэта 93.3 адсотка. Яна ў парога 0.7, які знаходзіць 3 файлы са 163 рэальна змененых.

мадэль з найлепшай accuracy на разбегу, парог 0.7 праўда змяніўся праўда не прадказала праўку 3 0 не прадказала нічога 160 2226 accuracy 93.3, дакладнасць 100, паўната 1.8 прапушчана 160 правак са 163
Дакладнасць у 100 адсоткаў выглядае трыумфам, пакуль не прачытана суседняя клетка. Мадэль правая заўсёды, калі адкрывае рот. Адкрывае яна яго амаль ніколі.

Усе парогі разбегу стаяць у адной паласе, ад 92.5 да 93.3, а паўната ідзе з 19.6 адсотка ўніз да 0.6. Адзін лік не адрознівае мадэль, якая знаходзіць кожную пятую праўку, ад мадэлі, якая знаходзіць адну са 163. Іх абедзвюх ён не адрознівае і ад адказу “ніколі”.

Матрыца памылак адрознівае іх з аднаго погляду. Тры супраць ста шасцідзесяці гэта сама рэч, а не яе пераказ.

Дзе метрыка працуе

Хачу быць сумленным да accuracy, таму вось той жа дослед з гарызонтам, расцягнутым з 7 дзён да 90. Цяпер станоўчых 34.6 адсотка, адказ “ніколі” дае 65.4, а найлепшая мадэль даходзіць да 70.7 пры паўнаце 31 адсотак. Лік рухаецца, ранжыруе парогі і паводзіць сябе як метрыка.

Вось і ўся форма праблемы. Accuracy гэта ўзважанае сярэдняе двух лікаў, а вагамі стаяць памеры класаў. Калі адзін клас займае 93 адсоткі даных, сярэдняе роўнае гэтаму класу. Другі сыходзіць у акругленне.

Дзе я спатыкнуўся

Спачатку я прагнаў версію на 90 дзён, атрымаў той самы мяккі вынік і потым вярнуўся і скараціў гарызонт, каб дысбаланс стаў рэзкім. Гэта варта сказаць проста: я падбіраў задачу, пакуль эфект не з’явіўся. Сумленная форма майго сцвярджэння вузейшая за “accuracy бескарысная”: адзін і той жа дослед паказвае правал пры 6.8 адсотка станоўчых і хавае яго пры 34.6. Гэтую фразу па першым прагоне напісаць было нельга.

Чаго я не правяраў

Плошчу пад крывой, а менавіта за ёй цягнуцца роўна ў такім выпадку. Па пабудове яна не залежыць ад парога, які я разбягаў. Ці адкалібраваная мадэль, то бок ці значыць адзнака 0.7, што падзея адбываецца ў 70 адсотках выпадкаў. І мадэль гэта 3 прыкметы на 1 рэпазіторыі, таму пра тое, наколькі ўвогуле прадказальныя праўкі файлаў, тут не сказана нічога. Сказана пра тое, што паведамляе і чаго не паведамляе апублікаваны лік.

Вузкае сцвярджэнне гэта пытанне, якое трэба задаваць у той зале. Не якая там accuracy, а колькі сапраўдных выпадкаў мадэль знайшла і як часта памылялася, калі адкрывала рот.