top of page

Независимо измерване: един модел - GPT-6 Astra - два различни отговора

5.09
време за четене: 4 мин.
На 3 септември OpenAI пусна GPT-6 Astra и го определи като първия си модел, достигнал критично ниво по киберспособности. Ден по-късно външна фирма за измервания публикува своите числа за същия модел. Двете картини не си противоречат, но водят до различни решения, а разликата е точно в това какво се мери.

Двама души мерят един и същ робот с различни уреди и всеки сочи на другия своя циферблат с несъгласие, докато роботът стои неподвижно между тях

Какво обяви производителят


Системната карта на модела е категорична в едно: това е първият им модел, достигнал критичното ниво по кибербезопасност в тяхната собствена рамка за готовност. Формулировката е тяхна, не наша.


Числата зад нея идват от външна лаборатория, наета за оценката. На един от наборите задачи моделът решава 86 от 226 задачи срещу 34 от 226 за предшественика си, а на друг, който проверява дълги настъпателни сценарии, стига до 9 от 10 срещу 6 от 10, при среден успех 59%.


Тук обаче се крие уточнението, което заглавията пропуснаха. Същата лаборатория отбелязва, че не е наблюдавала успешни атаки срещу напълно укрепени цели и че нито един от двата модела не е решил която и да е от седемте задачи от най-тежката група. Самата карта добавя, че всички оценки са долна граница, а не таван.


Същият модел през независимо измерване


Тук се появява второто число. Независимо измерване на фирма, която класира модели по обща способност, поставя новия модел на 61 точки в своя индекс за интелигентност. Предшественикът му стои на същите 61 точки. За сравнение, водачът в класацията е на 66.


Разминаването между обявено и премерено число не е новост. Описали сме подобен случай в по-ранна наша новина за независимото измерване на филтрите, където проверката промени смисъла на обявения резултат.


Цената междувременно се вдига. От 4 и 20 долара за милион входни и изходни токена тя минава на 10 и 50 долара, което самата фирма описва като 2,5 пъти нагоре по цялата линия. Понеже новият модел изразходва около 10% по-малко изходни токени, крайната сметка за една задача излиза със 75% по-висока, а не 2,5 пъти.


Има и ясно подобрение, което си струва да се отбележи. Делът на грешните отговори сред всички неуспешни отговори пада от 92% на 51%. Това не значи, че моделът е грешал в 92% от случаите, а че когато не е знаел, почти винаги е изричал нещо вместо да се въздържи. Сега се въздържа наполовина по-често.


Къде същият модел печели убедително


Ако разказът спираше дотук, изводът щеше да е прост и ясен. Но същата фирма мери и работа с код, а там присъдата е обратна.


По показателя за агенти за програмиране новият модел настига водача в класацията, но при по-малко от половината разход, воден от около три пъти по-икономична работа с токени. Фирмата го формулира направо: двата ѝ основни индекса разказват различни истории за един и същ модел.


Тоест въпросът „по-добър ли е новият модел" няма отговор, преди да се уточни за каква работа. За общи запитвания и разсъждение промяна практически няма, а цената е нараснала. За работа с код сметката излиза в полза на новия.


Какво следва при избор на модел


Практическият извод не е скептицизъм към производителя, а по-точен въпрос.


Първо, обявеното ниво описва риск, не полезност. Критичното ниво по киберспособности е твърдение за това какво моделът може да навреди, а не обещание, че ще пише по-добри писма. Двете редовно се смесват в преразказите.


Второ, независимата оценка също иска четене с уговорка. Фирмата, която мери, продава измервания, а част от външните оценители в самата карта са платени изпълнители по договор. Един от тях е държавен орган на друга държава, което е различен случай и не бива да се слага в същия кош.


Трето и най-полезно за всекидневната работа: сравнението, което има значение, е върху собствените Ви задачи, с реален обем и реална цена, а не върху чужда класация. Двайсет типични запитвания, пуснати през два модела с еднакво условие, дават по-надежден отговор от която и да е таблица.


Заключение


Един и същ модел получи оценка „критичен" от производителя си и „без промяна" от независимо измерване на общата способност, като и двете са верни за онова, което мерят. Числото без въпроса какво точно е измерено не носи информация, а само увереност.


Помагаме на български организации да избират AI модели по собствените си задачи, а не по чужди класации. Услугите ни покриват одит, оценка на готовност, обучение на екипи и имплементация на специализирани AI автоматизации за всяка организация. Препоръчваме консултация при сравняване на доставчици и при планиране на разхода за токени. [Свържете се с нас за консултация: academy@razvivai.se]


Източници



Този текст е създаден в съавторство с AI и е редактиран от екипа на РазвивAI се. Илюстрацията към публикацията е генерирана с AI.

Коментари


bottom of page