dimhold.by

Статьи

27 статей Архив →

14 сентября 2026 г.

Please стоит 24 доллара на миллион вызовов. Это ничто. Just the answer стоило мне 32.5 балла точности

Год назад я вычистил из шаблонов промптов все please и thank you из-за шутки Сэма Альтмана про электричество. Сколько сэкономил, так и не проверил. Через 20171 вызов вежливая обёртка стоит 24 доллара на миллион запросов у sonnet и двигает ответ не сильнее, чем контрольная обёртка без единого социального слова. Двигает другая: указание про длину ответа уводит haiku на GSM8K с 88.5 процента до 56.0.

16 мин чтения

языковые модели статистика производительность

13 сентября 2026 г.

На середине апгрейда половина моей коллекции набрала 0

Бамп версии внутри одного семейства моделей выглядел как патч, поэтому я померил, что он делает с поиском. Из первой десятки меняется 2.19 места, а nDCG@10 шевелится в третьем знаке. Фиксированное отсечение по косинусу 0.8 пропускало 97.5% результатов и стало пропускать 1.8%, а индекс на середине миграции отдаёт 0 релевантных документов для половины коллекции.

13 мин чтения

машинное обучение языковые модели надёжность

6 сентября 2026 г.

2 строки комментария превратили 62 находки в 0

Ревью кода у меня идёт в 3 стадии и размер ни одной из них я не выбирал по замеру. После 191 вызова модели стадия, которую я защищал бы яростнее всего, ни разу не разошлась сама с собой. Неправым раз за разом оказывался мой собственный измерительный аппарат: 2 строки комментария в контрольном файле опустили 62 находки до 0.

21 мин чтения

агенты качество кода языковые модели

4 сентября 2026 г.

В скрипте не менялось ничего и 24 из моих 36 агентов отработали заново

Замер здесь это 36 агентов и способ, которым я их гоняю, я называл детерминированным, ни разу не померив, что это слово покрывает. Конвейер обгоняет барьер на 23.9 процента по времени. Он же раздаёт номера вызовов тому, кто закончил первым, и журнал с ключом по позиции возвращает 12 агентов из 36 на прогоне, где не поправлено вообще ничего.

12 мин чтения

агенты производительность надёжность

3 сентября 2026 г.

Критик пропускает 13 из 16 черновиков, которые заваливает механика

Каждый черновик здесь проходит 19 механических проверок, а потом критика-модель с оценкой от 0 до 10. Я повторяю, что механика решает то, у чего есть однозначный ответ, а суждение остаётся критику. Числом я это ни разу не проверял. На 16 настоящих черновиках механика сработала на всех 16, а 13 легли на проходной оценке или ниже. Подсади 8 нарушений моего правила про запятую: критик всё равно скажет 2.7.

12 мин чтения

языковые модели качество кода

2 сентября 2026 г.

Модель, прочитавшая мои эссе, возвращает 2 правила из 16

Мне постоянно говорят, что свод правил голоса не нужен: покажи модели опубликованное и дай ей вывести голос самой. Я отдал claude-opus-5 8 из своих 11 английских эссе и попросил написать свод. За 5 прогонов она написала 92 записи, из них моих 2. Все 16 проверок дают 0 на 12587 словах опубликованной прозы, а у 6 из них 0 и в базах сравнения, то есть искать там было нечего.

16 мин чтения

языковые модели машинное обучение

1 сентября 2026 г.

15 лет после Simple Made Easy: в 2013 году ни одна из моих 102 локальных переменных не была final, сейчас в живом коде 91.6% это const. Я не выбирал ни того ни другого

В мае 2013 года я завёл репозиторий, чтобы перевести доклад Рича Хикки на русский. Он до сих пор на 0%. На той же неделе я закоммитил синхронизированные коллекции в java-сервер. Я собрал ту форму заново и померил: частоту падений коммит не сдвинул вообще. Потом прогнал список из Simple Made Easy по своему коду. В 2013 году ни одна из 102 локальных переменных не была final, сейчас в живом коде 91.6% это const. Я не выбирал ни того ни другого.

9 мин чтения

качество кода типы

30 августа 2026 г.

Simple Made Easy на моих собственных диффах: 85% выброшенного кода ушло одним коммитом

Я вынул дашборд из этой машины через 2 дня и 22 часа после того, как она его написала. Сколько ещё ушло тем же путём, я ни разу не считал. 508 коммитов спустя: 57.4% слов кода нет, из них 85.0% ушли одним коммитом. Первые 5 файлов по ширине сплетения это те самые 5, что снял тот коммит.

13 мин чтения

качество кода git

29 августа 2026 г.

Индекс, про который я говорил, что он ничего не даст: 2.8 мс против 8.3

Состояние этой машины лежит в файлах markdown, и я объясняю это фразой про скорость, которую ни разу не мерил. Я собрал индекс SQLite, про который говорил, что он ничего не даст, и замерил на 1x, 10x и 100x. Он выигрывает везде, а потом выяснилось, что я мерил fsync.

14 мин чтения

агенты базы данных производительность

27 августа 2026 г.

Часовой пояс, который выдают мои публичные коммиты, неверный

26 публичных репозиториев и 510 моих коммитов. Оценка часового пояса по часам, в которые эти коммиты сделаны, даёт единственный чистый минимум на +1. В 422 объектах из 510 записано +03:00. Чем больше меток времени, тем увереннее неверный ответ. А смещение, ради которого я поднял 26 клонов, лежит в одном GET без логина.

12 мин чтения

git время открытые данные

20 августа 2026 г.

Сколько собака проходит за одну прогулку с человеком

Два телефона, один лес, час двадцать. Один в кармане, другой в носке на ошейнике. GPS раз в секунду. Зум прошёл 5,42 км, я — 4,09. Но интереснее оказалось не то, насколько больше, а почему: медианная скорость у нас почти одинаковая, вся разница сидит в хвостах распределения.

3 мин чтения

статистика числа

11 июня 2014 г.

9 моделей, accuracy от 92.5 до 93.3, и одна из них не находит ничего

На задаче с 6.8 процента положительных примеров любой порог дал accuracy в пределах 0.8 пункта, пока полнота падала с 19.6 процента до 0.6. Ответ никогда на всё подряд даёт 93.2. Матрица ошибок различает эти модели мгновенно, а одно число не различает их вообще.

5 мин чтения

машинное обучение статистика