У красавіку 2025 нехта ў X уголас прыкінуў, колькі электрычнасці OpenAI паліць на тым, што людзі кажуць мадэлям “калі ласка” і “дзякуй”. Сэм Альтман адказаў назаўтра: дзясяткі мільёнаў даляраў, выдаткаваных не дарма, мала што. Гэта быў жарт, ніякага разліку ніхто не публікаваў. Я ўсё роўна ўспрыняў лічбу як бюджэтную, адкрыў шаблоны промптаў ва ўласных інструментах і вычысціў адтуль усе please і thank you. Пайшоў вечар. Пра рахунак мне пасля гэтага думалася прыямней.
Колькі я зэканоміў, я так і не праверыў. У ліку, на які я зрэагаваў, нідзе побач не было назоўніка. Мой уласны месячны вынік гуляе мацней, чым на памылку акруглення, варта аднаму прагону агента пайсці кепска, таму эканомія больш за год заставалася адчуваннем. На гэтым тыдні я пасадзіў яе на стэнд. Лік, з якім я адтуль выйшаў, аказаўся не тым, па які я ішоў.
Стэнд
5 абгортак вакол задачы, прычым тэкст самой задачы ўнутры іх супадае пасімвальна. Голая абгортка bare гэта проста задача. please ставіць перад ёй Please help me with this. і Thank you. пасля. Доўгая прыязная рамка warm пачынаецца з Hello! I hope you are having a good day. і заканчваецца падзякай. Рэзкая rude гэта Do this now. спераду і Just the answer. Do not waste my time. ззаду.
filler гэта кантроль, які мне тут даражэйшы за ўсё. Тая ж даўжыня ў токенах, што ў warm. Ніводнага сацыяльнага слова: Record 44 of the batch. The batch was compiled on a Tuesday morning. <задача> The batch identifier is QF-2231 and it carries no meaning for it. Калі warm нешта рухае, а filler не рухае, значыць гэта працуе ветлівасць. Калі рухаюць абодва, значыць усё, што я пабудаваў, гэта проста промпт даўжэйшы. Кантроль я сабраў першым, бо ў дзвюх працах, якія я знайшоў, яго няма. Інь з сааўтарамі (arXiv 2402.14531) прагналі 8 узроўняў ветлівасці на англійскай, кітайскай і японскай і пішуць, што грубыя промпты працуюць горш, а залішняя ветлівасць не дае нічога. Дабарыя і Кумар (arXiv 2510.04950) атрымалі 84.8 працэнта ў вельмі грубага супраць 80.8 у вельмі ветлівага на GPT-4o. Ні там ні там даўжыня промпта не замацавана.
Задачы: 40 штук з тэставай часткі GSM8K і 12 адкрытых пытанняў без патрабаванняў да фармату. Сярэдзіну шкалы трымаюць 30 множанняў 5 знакаў на 3 і 30 множанняў 4 на 4, бо GSM8K занадта лёгкі, каб на вялікай мадэлі ўбачыць шкоду. Кожная задача прайшла 5 разоў пад кожнай абгорткай на абедзвюх мадэлях. Адкрытыя пытанні прайшлі па 4 разы, адсюль лік кшталту 200 выклікаў і 48 адказаў.
Claude Code 2.1.235, мадэлі claude-haiku-4-5 і claude-sonnet-5, рэжым разважання выключаны, інструменты выключаны, MCP пусты. Афлайнавы лік токенаў зняты праз tiktoken 0.14.0 і transformers 5.16.1 на Python 3.12.3. Кожны выклік ішоў з пустой папкі ў /tmp, над якой нідзе няма CLAUDE.md. Гэта прыдзірлівасць, але з прычынай: CLI чытае інструкцыі з рабочай папкі і не паведамляе пра гэта. Адзін мой мінулы замер ціха сапсаваў мой жа файл з правіламі пісьма, які тлумачыў мадэлі, як пісаць.
Цэны знятыя са старонкі Anthropic 14 верасня 2026. У haiku гэта 1 даляр за ўваход і 5 за выхад на мільён токенаў, у sonnet 5 гэта 2 і 10. У мяне па памяці было запісана 3 і 15. Гэта цана папярэдняга пакалення. Праз яе ўсе даляравыя лікі sonnet у першым чарнавіку стаялі на 50 працэнтаў вышэй.
Выключаныя інструменты важныя яшчэ па адной прычыне. Пры наборы інструментаў па змаўчанні прэамбула аднаго выкліку важыць 18658 уваходных токенаў у haiku і 24729 у sonnet. Эфект, які я шукаю, шырынёй у 9 токенаў.
Уваход
9 токенаў у haiku, 12 у sonnet. На ўсіх 112 задачах мінімум і максімум гэта адзін і той жа лік. Абгортка гэта фіксаваны радок, задача садзіцца паміж яе палавінамі і ніводную з іх не кранае. Афлайн cl100k_base, o200k_base, Qwen2.5-7B і Mistral-7B даюць на тым жа радку 8 або 9 токенаў, так што гэта не асаблівасць Anthropic. Па гэтых цэнах please каштуе 9 даляраў у haiku і 24 у sonnet на мільён запытаў. Доўгая цёплая рамка гэта 35 і 90.
Дзе насамрэч ляжыць рахунак
Выхад каштуе ў 5 разоў даражэй за ўваход на абедзвюх мадэлях. Калі thank you прымушае мадэль адказаць you are welcome, лішнія словы кладуцца на выхадны бок.
Водгук ёсць. Знайсці яго лёгка. На адкрытых пытаннях 47 адказаў sonnet з 48 пад цёплай абгорткай нясуць прапанову дапамагчы яшчэ, з пароды let me know if. Голая задача даходзіць да гэтага 9 разоў з 48. У haiku лік 40 супраць 0. Адзін адказ haiku пра індэксы ў базе заканчвае апошні абзац словамі You're welcome! і прапануе расказаць пра базы яшчэ нешта. Мадэль адказвае на прывітанне ці проста трапляе ў пададзены рэгістр, па адным закрывальным радку я гэтага не скажу.
Да рахунку амаль нічога з гэтага не даходзіць. На адкрытых пытаннях, спараных па задачах, цёплая абгортка дадае 21.4 выхаднога токена ў sonnet пры 95-працэнтным інтэрвале ад -23.2 да 58.4. Please дадае 21.1. Абодва інтэрвалы накрываюць нуль. У haiku абодва ідуць у невялікі мінус. Закрывальная фраза важыць 15 токенаў, а адказы sonnet вакол яе ў сярэднім ад 561 да 1138 у залежнасці ад пытання, таму яна там тоне.
Адну клетку выхад усё ж купляе. Гэта haiku на GSM8K: 8.0 токена пры інтэрвале ад 0.1 да 16.5. На мільён запытаў выходзіць 40 даляраў супраць 9 на ўваходным баку. Гэта адзіны інтэрвал на фігуры вышэй, які не накрывае нуль. Sonnet на той жа сям’і ідзе ў другі бок і на ветлівую просьбу піша на 5.7 токена менш.
Ці мяняе please адказ
Найчысцейшая пастаноўка гэтага пытання наогул не глядзіць, ці правільны адказ. Прагнаць адну абгортку двойчы і палічыць, як часта два прагоны разыходзяцца. Потым прагнаць голую абгортку супраць ветлівай і палічыць тое самае. У haiku на GSM8K адна і тая ж абгортка разыходзіцца сама з сабой у 20.9 працэнта выпадкаў, а голая супраць ветлівай у 12.4. У sonnet наадварот: 6.8 супраць 12.8.
Значыць ветлівасць каштуе некалькіх пунктаў нестабільнасці ў той ці іншы бок, залежна ад мадэлі. Вырашае справу кантроль filler. Голая супраць яго гэта 13.6 працэнта ў haiku на GSM8K і 10.1 у sonnet. Абодва лікі кладуцца роўна на ветлівы лік той жа клеткі. Астатнія 4 клеткі таксама. Абгортка, у якой няма ніводнага сацыяльнага слова, трывожыць адказ роўна настолькі ж, наколькі ветлівая. Змена абгорткі крыху рухае адказ. Ветлівая гэтая змена ці не, на велічыню не ўплывае.
Долі правільных адказаў кажуць тое самае. У haiku на GSM8K голая задача набірае 88.5 працэнта на 200 выкліках, ветлівая 89.0. Кожны інтэрвал перакрываецца з кожным. Цёплая рамка і кантроль filler садзяцца ніжэй, у раёне васьмідзесяці з нечым, што супрацьлеглае чаканню ад ветлівасці і ўсё роўна ўнутры шуму.
Абгортка, якая зрушыла
Рэзкая. У haiku на GSM8K яна зводзіць долю правільных з 88.5 працэнта да 53.5, а сярэдні адказ з 79.7 выхаднога токена да 11.7.
rude я напісаў як Do this now. <задача> Just the answer. Do not waste my time. І толькі пасля першага прагону прачытаў гэты радок як след і ўбачыў, што ў яго зварылі дзве розныя рэчы. Адна гэта тон. Другая гэта ўказанне пра форму адказу. Таму я дадаў яшчэ 2 абгорткі. rude_soft гэта тая ж рэзкая рамка, з якой прыбрана Just the answer. terse гэта Just the answer. без ніякай рэзкасці вакол.
rude_soft набірае 65.5 працэнта, terse 56.0. Абедзве ідуць ніжэй за голую задачу з яе 88.5. Інтэрвалы ў іх перакрываюцца амаль па ўсёй даўжыні, таму сцвярджаць, што адна палова горшая за другую, я не буду. Прагон здымае тое прачытанне, з якім я ў яго заходзіў, дзе шкодзіла менавіта грубасць. У terse грубасці няма зусім, а садзіцца ён ніжэй, чым рэзкая рамка.
Побач ідуць даўжыні адказаў: 31.6 токена ў рэзкай рамкі, 20.1 у голага ўказання, 79.7 у голай задачы. Маё прачытанне такое, што мадэль перастае распісваць крокі і пасля гэтага памыляецца ў арыфметыцы, але пра механізм гэта здагадка. Прагон памераў іншае: кароткія адказы і няправільныя адказы прыходзяць разам. Sonnet трымаецца паміж 88.5 і 95.5 працэнта на любой абгортцы.
Той жа раскол відаць у даларах на адкрытых пытаннях. Спараная па задачах поўная рэзкая абгортка зрэзвае 614.2 выхаднога токена з адказу sonnet, адна рэзкая рамка 495.4, адно ўказанне пра фармат 470.2. Па апублікаванай цане выхаду гэтая рэзкая абгортка эканоміць 6142 даляры на мільён запытаў.
Чаго я не правяраў
filler гэта нячысты кантроль на даўжыню. Ён прыбірае сацыяльныя словы і дадае старонні змест пра партыю QF-2231. Па токенах ён супадае з warm. Па сэнсе токены там кажуць зусім іншае. 2 мадэлі адной лабараторыі. Увесь вынік па GSM8K трымаецца на малодшай. Сістэмны промпт на кожным выкліку быў прыбіты да You are a helpful assistant., так што сапраўдны сістэмны промпт, які сам задае тон, ляжыць за мяжой замеру.
Першы заход памёр на 1848 выкліках і 2.83 даляра, упёршыся ў ліміт выдаткаў, які вярнуў 429 на наступныя 3152. Каб закрыць сетку, спатрэбілася яшчэ 3 прысесты. Няўдалы журнал я не стаў выдаляць: парадак выклікаў перамяшалі да старту, таму прыпынак на сярэдзіне пакідае выпадковую падвыбарку, а не зрэз па адным варыянце.
Яшчэ адно я зрабіў няправільна і заўважыў толькі ў канцы. Мой грэйдэр параўноўваў адказы радкамі і здымаў роўна адзін хвост .0, таму 16.00 пры эталоне 16 ішло ў няправільныя. Гэта 117 выклікаў з 7000. Ляглі яны не пароўну: 17 у клетцы filler супраць 1 у голай клетцы на sonnet. Усе долі правільных адказаў вышэй атрыманыя пералікам па захаваных адказах, а не новым прагонам.
Я вяртаю please у шаблоны. На sonnet гэта 24 даляры на мільён запытаў, а я трачу больш за адзін няўдалы вечар.