top of page

Цената се мери на завършена задача, не на извикване

6.09
време за четене: 3 мин.
На 2 септември инженерен екип на GitHub публикува как е свалил разхода при работа с AI агент, без да разваля качеството. По-полезната част от текста обаче е за опита, който се е обърнал срещу тях. Всеки отделен отговор е излязъл по-къс, а задачата средно е използвала повече токени и е отнела повече време.

Жена отрязва парче от лист и подава по-късото на робот, а роботът се връща при нея три пъти да иска липсващото, докато купчината върнати листове до крака му вече е по-висока от целия първоначален лист

Какво е измерил екипът


Четири отделни промени са дали спестяване, всяка измерена самостоятелно. По данните към публикацията: избирателното свиване на изхода сваля разхода с 5,5%, махането на номерата на редовете пред всеки ред от файл - с 3,1%, свиването на инструкциите към един от вътрешните инструменти - с 2,9%, и намаляването на обиколките за известия - с 2,3%.


Числата изглеждат като за събиране и точно това екипът изрично отрича: ефектите не са задължително строго адитивни. Общата цифра не се получава от сбор, защото промените се застъпват върху едни и същи заявки и част от икономията се отчита повторно.


Отделните измервания също се различават според мястото. Махането на номерата на редовете дава около 5% в офлайн изпитанието и около 3% при реални потребители. Свиването на инструкциите чрез отделна подсказка съкращава текста наполовина и спестява около 1300 токена на ход.


Обратният резултат


Петата промяна е тръгнала по същата логика и е дала обратното.


Екипът е свил отговорите, които инструментите връщат към модела. Моделът е получил по-малко, установил е, че му липсва нещо, и се е върнал да си го поиска. Дословната формулировка в публикацията е, че тези възстановителни стъпки са добавили ходове и са понесли повече контекст напред, а изводът е: спестено локално, похарчено глобално.


Отделният отговор е бил по-къс, но задачата средно е използвала повече токени и е отнела повече време.


Заслужава да се отбележи и уговорката, която самите автори слагат: резултатът важи за тяхната конкретна интеграция и за натоварванията, които са изпитали, а не за свиването на изхода изобщо.


Защо завършена задача е верният мерител


Механизмът не е особеност на един екип. Независимо измерване на друга група, публикувано през май и ревизирано през юни, стига до същото по съвсем друг път - като сравнява как се изписват извикванията на инструменти.


Там едно от компактните представяния увеличава общия брой токени с до 21%, защото общото заглавие на партидата струва повече от повторенията, които спестява. Второ наблюдение е още по-пряко: една провалена обработка на едно извикване води до допълнителна итерация на разсъждение. Две или три такива итерации изяждат цялата икономия, натрупана на дребно през целия ход на задачата.


Общото между двата случая е, че сметката се къса на място, което не се вижда в тарифата. Токените на извикване падат, броят на извикванията расте, и втората промяна е по-голяма от първата. Затова единственото число със смисъл е разходът за една завършена задача, измерен от заявката на потребителя до готовия резултат.


Същата форма на разсъждение се среща и извън икономиката на токените. Екип на Shopify, който пусна агент за поправка на уязвимости, описва своя мерител с почти същите думи: броят подадени поправки мери движение, а не решен проблем. Там разходът изобщо не се обсъжда, но разграничението между действие и резултат е едно и също.


Какво може да се направи


Изводът е приложим и без инженерен екип зад гърба.


Първо, мерете от заявката на потребителя до готовия резултат. Цена на извикване, среден брой токени и дължина на отговора описват движение, не свършена работа. Същото разместване вече върви и при еталоните, които от тази година започнаха да мерят цели агентни задачи вместо отделни отговори - по-ранна наша новина по темата.


Второ, гледайте дела на неуспешните опити наравно с разхода. Промяна, която спестява 5% на извикване, но добавя по едно повторение на всеки двадесет задачи, е нетна загуба.


Трето, изпитвайте промяната, вместо да я допускате. Свиването на контекста е разумно по подразбиране точно толкова, колкото и обратното, и единственият начин да се разбере кое важи за Вашия случай е сравнителен опит върху реални задачи.


Заключение


Оптимизацията по токени на отделно извикване изглежда като безспорна печалба, защото се вижда веднага и се мери лесно. Ефектът ѝ обаче се проявява един слой по-навън, където агентът наваксва липсващото, и точно там се решава дали сметката пада, или расте.


Помагаме на български екипи да измерят реалния разход на своите AI автоматизации - по завършена задача, не по извикване. Услугите ни покриват одит, оценка на готовност, обучение на екипи и имплементация на специализирани AI автоматизации за всяка организация. Препоръчваме консултация при изграждане на агент, който работи в много стъпки и ползва външни инструменти. [Свържете се с нас за консултация: academy@razvivai.se]


Източници



Този текст е създаден в съавторство с AI и е редактиран от екипа на РазвивAI се. Илюстрацията към публикацията е генерирана с AI.

Коментари


bottom of page