dimhold.by

Артыкулы

27 артыкулаў Архіў →

14 верасня 2026 г.

Please каштуе 24 даляры на мільён выклікаў. Гэта нішто. Just the answer каштавала мне 32.5 бала дакладнасці

Год таму я вычысціў з шаблонаў промптаў усе please і thank you праз жарт Сэма Альтмана пра электрычнасць. Колькі зэканоміў, так і не праверыў. Праз 20171 выклік ветлівая абгортка каштуе 24 даляры на мільён запытаў у sonnet і рухае адказ не мацней, чым кантрольная абгортка без ніводнага сацыяльнага слова. Рухае іншая: указанне пра даўжыню адказу зводзіць haiku на GSM8K з 88.5 працэнта да 56.0.

16 хв чытання

моўныя мадэлі статыстыка хуткадзейнасць

13 верасня 2026 г.

На сярэдзіне апгрэйда палова маёй калекцыі набрала 0

Бамп версіі ўнутры аднаго сямейства мадэляў выглядаў як патч, таму я памераў, што ён робіць з пошукам. З першай дзясяткі мяняецца 2.19 месца, а nDCG@10 рухаецца ў трэцім знаку. Фіксаванае адсячэнне па косінусе 0.8 прапускала 97.5% результатаў і стала прапускаць 1.8%, а індэкс на сярэдзіне міграцыі аддае 0 рэлевантных дакументаў для паловы калекцыі.

13 хв чытання

машыннае навучанне моўныя мадэлі надзейнасць

6 верасня 2026 г.

2 радкі каментара ператварылі 62 знаходкі ў 0

Рэўю кода ў мяне ідзе ў 3 стадыі і памер ніводнай з іх я не выбіраў паводле замеру. Пасля 191 выкліку мадэлі стадыя, якую я бараніў бы найзацяцей, ні разу не разышлася сама з сабой. Няправым раз за разам аказваўся мой уласны вымяральны апарат: 2 радкі каментара ў кантрольным файле апусцілі 62 знаходкі да 0.

21 хв чытання

агенты якасць кода моўныя мадэлі

4 верасня 2026 г.

У скрыпце не мянялася нічога і 24 з маіх 36 агентаў адпрацавалі нанова

Замер тут гэта 36 агентаў і спосаб, якім я іх ганяю, я называў дэтэрмінаваным, ні разу не памераўшы, што гэтае слова ахоплівае. Канвеер абганяе бар'ер на 23.9 працэнта па часе. Ён жа раздае нумары выклікаў таму, хто скончыў першым, і журнал з ключом па пазіцыі вяртае 12 агентаў з 36 на прагоне, дзе не папраўлена наогул нічога.

12 хв чытання

агенты хуткадзейнасць надзейнасць

3 верасня 2026 г.

Крытык прапускае 13 з 16 чарнавікоў, якія завальвае механіка

Кожны чарнавік тут праходзіць 19 механічных праверак, а потым крытыка-мадэль з адзнакай ад 0 да 10. Я паўтараю, што механіка вырашае тое, у чаго ёсць адназначны адказ, а меркаванне застаецца крытыку. Лікам я гэта ні разу не правяраў. На 16 сапраўдных чарнавіках механіка спрацавала на ўсіх 16, а 13 леглі на праходнай адзнацы або ніжэй. Падсадзі 8 парушэнняў майго правіла пра коску: крытык усё роўна скажа 2.7.

12 хв чытання

моўныя мадэлі якасць кода

2 верасня 2026 г.

Мадэль, якая прачытала мае эсэ, вяртае 2 правілы з 16

Мне пастаянна кажуць, што звод правілаў голасу не патрэбны: пакажы мадэлі апублікаванае і дай ёй вывесці голас самой. Я аддаў claude-opus-5 8 са сваіх 11 англійскіх эсэ і папрасіў напісаць звод. За 5 прагонаў яна напісала 92 запісы, з іх маіх 2. Усе 16 праверак даюць 0 на 12587 словах апублікаванай прозы, а ў шасці з іх 0 і ў базах параўнання, то бок шукаць там не было чаго.

16 хв чытання

моўныя мадэлі машыннае навучанне

1 верасня 2026 г.

15 гадоў пасля Simple Made Easy: у 2013 годзе ніводная з маіх 102 лакальных зменных не была final, цяпер у жывым кодзе 91.6% гэта const. Я не выбіраў ні таго ні другога

У маі 2013 года я завёў рэпазіторый, каб перакласці даклад Рыча Хікі на рускую. Ён дагэтуль на 0%. На тым жа тыдні я закаміціў сінхранізаваныя калекцыі ў java-сервер. Я сабраў тую форму нанова і памераў: частату падзенняў каміт не зрушыў увогуле. Потым прагнаў спіс з Simple Made Easy па сваім кодзе. У 2013 годзе ніводная з 102 лакальных зменных не была final, цяпер у жывым кодзе 91.6% гэта const. Я не выбіраў ні таго ні другога.

10 хв чытання

якасць кода тыпы

30 жніўня 2026 г.

Simple Made Easy на маіх уласных дыфах: 85% выкінутага кода пайшло адным камітам

Я выняў дашборд з гэтай машыны праз 2 дні і 22 гадзіны пасля таго, як яна яго напісала. Колькі яшчэ пайшло тым жа шляхам, я ні разу не лічыў. 508 камітаў пазней: 57.4% слоў кода няма, з іх 85.0% пайшлі адным камітам. Першыя 5 файлаў па шырыні спляцення гэта тыя самыя 5, што зняў той каміт.

13 хв чытання

якасць кода git

29 жніўня 2026 г.

Індэкс, пра які я казаў, што ён нічога не дасць: 2.8 мс супраць 8.3

Стан гэтай машыны ляжыць у файлах markdown, і я тлумачу гэта фразай пра хуткасць, якую ні разу не мерыў. Я сабраў індэкс SQLite, пра які казаў, што ён нічога не дасць, і замерыў на 1x, 10x і 100x. Ён выйграе ўсюды, а потым высветлілася, што я мерыў fsync.

14 хв чытання

агенты базы даных хуткадзейнасць

27 жніўня 2026 г.

Часавы пояс, які выдаюць мае публічныя каміты, няправільны

26 публічных рэпазіторыяў і 510 маіх камітаў. Ацэнка часавога пояса па гадзінах, у якія гэтыя каміты зробленыя, дае адзіны чысты мінімум на +1. У 422 аб'ектах з 510 запісана +03:00. Чым больш меркаў часу, тым упэўненей няправільны адказ. А зрух, дзеля якога я падняў 26 клонаў, ляжыць у адным GET без лагіна.

12 хв чытання

git час адкрытыя даныя

20 жніўня 2026 г.

Колькі сабака праходзіць за адну прагулку з чалавекам

Два тэлефоны, адзін лес, гадзіна дваццаць. Адзін у кішэні, другі ў шкарпэтцы на ашыйніку. GPS раз на секунду. Зум прайшоў 5,42 км, я — 4,09. Але цікавейшым аказалася не наколькі больш, а чаму: медыянная хуткасць у нас амаль аднолькавая, а ўся розніца сядзіць у хвастах размеркавання.

3 хв чытання

статыстыка лікі

11 чэрвеня 2014 г.

9 мадэляў, accuracy ад 92.5 да 93.3, і адна з іх не знаходзіць нічога

На задачы з 6.8 адсотка станоўчых прыкладаў любы парог даў accuracy ў межах 0.8 пункта, пакуль паўната падала з 19.6 адсотка да 0.6. Адказ ніколі на ўсё запар дае 93.2. Матрыца памылак адрознівае гэтыя мадэлі імгненна, а адзін лік не адрознівае іх увогуле.

5 хв чытання

машыннае навучанне статыстыка