Независимо измерване: един модел - GPT-6 Astra - два различни отговора
На 3 септември OpenAI пусна GPT-6 Astra и го определи като първия си модел, достигнал критично ниво по киберспособности. Ден по-късно външна фирма за измервания публикува своите числа за същия модел. Двете картини не си противоречат, но водят до различни решения, а разликата е точно в това какво се мери.

Какво обяви производителят
Системната карта на модела е категорична в едно: това е първият им модел, достигнал критичното ниво по кибербезопасност в тяхната собствена рамка за готовност. Формулировката е тяхна, не наша.
Числата зад нея идват от външна лаборатория, наета за оценката. На един от наборите задачи моделът решава 86 от 226 задачи срещу 34 от 226 за предшественика си, а на друг, който проверява дълги настъпателни сценарии, стига до 9 от 10 срещу 6 от 10, при среден успех 59%.
Тук обаче се крие уточнението, което заглавията пропуснаха. Същата лаборатория отбелязва, че не е наблюдавала успешни атаки срещу напълно укрепени цели и че нито един от двата модела не е решил която и да е от седемте задачи от най-тежката група. Самата карта добавя, че всички оценки са долна граница, а не таван.
Същият модел през независимо измерване
Тук се появява второто число. Независимо измерване на фирма, която класира модели по обща способност, поставя новия модел на 61 точки в своя индекс за интелигентност. Предшественикът му стои на същите 61 точки. За сравнение, водачът в класацията е на 66.
Разминаването между обявено и премерено число не е новост. Описали сме подобен случай в по-ранна наша новина за независимото измерване на филтрите, където проверката промени смисъла на обявения резултат.
Цената междувременно се вдига. От 4 и 20 долара за милион входни и изходни токена тя минава на 10 и 50 долара, което самата фирма описва като 2,5 пъти нагоре по цялата линия. Понеже новият модел изразходва около 10% по-малко изходни токени, крайната сметка за една задача излиза със 75% по-висока, а не 2,5 пъти.
Има и ясно подобрение, което си струва да се отбележи. Делът на грешните отговори сред всички неуспешни отговори пада от 92% на 51%. Това не значи, че моделът е грешал в 92% от случаите, а че когато не е знаел, почти винаги е изричал нещо вместо да се въздържи. Сега се въздържа наполовина по-често.
Къде същият модел печели убедително
Ако разказът спираше дотук, изводът щеше да е прост и ясен. Но същата фирма мери и работа с код, а там присъдата е обратна.
По показателя за агенти за програмиране новият модел настига водача в класацията, но при по-малко от половината разход, воден от около три пъти по-икономична работа с токени. Фирмата го формулира направо: двата ѝ основни индекса разказват различни истории за един и същ модел.
Тоест въпросът „по-добър ли е новият модел" няма отговор, преди да се уточни за каква работа. За общи запитвания и разсъждение промяна практически няма, а цената е нараснала. За работа с код сметката излиза в полза на новия.
Какво следва при избор на модел
Практическият извод не е скептицизъм към производителя, а по-точен въпрос.
Първо, обявеното ниво описва риск, не полезност. Критичното ниво по киберспособности е твърдение за това какво моделът може да навреди, а не обещание, че ще пише по-добри писма. Двете редовно се смесват в преразказите.
Второ, независимата оценка също иска четене с уговорка. Фирмата, която мери, продава измервания, а част от външните оценители в самата карта са платени изпълнители по договор. Един от тях е държавен орган на друга държава, което е различен случай и не бива да се слага в същия кош.
Трето и най-полезно за всекидневната работа: сравнението, което има значение, е върху собствените Ви задачи, с реален обем и реална цена, а не върху чужда класация. Двайсет типични запитвания, пуснати през два модела с еднакво условие, дават по-надежден отговор от която и да е таблица.
Заключение
Един и същ модел получи оценка „критичен" от производителя си и „без промяна" от независимо измерване на общата способност, като и двете са верни за онова, което мерят. Числото без въпроса какво точно е измерено не носи информация, а само увереност.
Помагаме на български организации да избират AI модели по собствените си задачи, а не по чужди класации. Услугите ни покриват одит, оценка на готовност, обучение на екипи и имплементация на специализирани AI автоматизации за всяка организация. Препоръчваме консултация при сравняване на доставчици и при планиране на разхода за токени. [Свържете се с нас за консултация: academy@razvivai.se]
Източници
GPT-6 Astra System Card - OpenAI, септември 2026
Benchmarking GPT-6 Astra - Artificial Analysis, септември 2026
Israeli startup Irregular linked to AI hacks at OpenAI, Anthropic and Meta - CNBC, август 2026
OpenAI launches GPT-6 Astra, its first model to cross a critical cybersecurity threshold - CSO Online, септември 2026
GPT-6 Astra scores 100% on ExploitBench as OpenAI blocks PoC exploit requests - The Hacker News, септември 2026
OpenAI releases GPT-6 Astra, its first model rated critical for cybersecurity - Unite.AI, септември 2026
Irregular raises 80 million dollars to set AI security standards for frontier models - SiliconANGLE, септември 2025
Този текст е създаден в съавторство с AI и е редактиран от екипа на РазвивAI се. Илюстрацията към публикацията е генерирана с AI.




Коментари