top of page

Оценка на AI модели: втори и 74-и за един и същ модел

18.08
време за четене: 3 мин.
Изборът на AI инструмент днес обикновено започва с класация. Тя изглежда като обективно измерване, защото има числа и подредба. Тази седмица един и същ модел, в една и съща версия, се появи на второ и на 74-о място в две независими класации. Разминаването не е грешка в нито една от двете.

Един и същ робот стои едновременно на второ стъпало на близък подиум и в дъното на дълга редица роботи зад него, а двама души пред двете табла спорят коя от двете подредби да отчетат

Един модел, две противоположни подредби


Vals AI класира DeepSeek V4-Pro втори от 82 модела по SWE-bench Verified с 96,40%, зад Claude Opus 5 с 97,00%. BenchLM класира същия модел, същата версия от 13 август, на 74-о място от 135 в категорията за програмиране с оценка 49,5 от 100.


Причината е в обекта на измерване. Vals AI мери един тест: 500 задачи в контейнер, с минимална обвивка от инструменти. BenchLM дава съставна категория от пет претеглени теста плюс десетки допълнителни, и понижава увереността си, когато покритието на даден модел е рядко. Двете подредби са едновременно верни, защото не отговарят на един и същ въпрос.


Какво показва статистиката зад класациите


Изследване от 11 август прилага теорията на обобщимостта върху три отворени набора със записи от изпълнение: TheAgentCompany, tau-2-bench и AppWorld. Резултатът е неудобен за начина, по който всички четем таблиците.


Ефектът на самия агент обяснява под 3% от общата разлика в резултатите при всеки от трите набора. Взаимодействието между агент и задача обяснява многократно повече. При най-трудната четвърт от задачите надеждността на измерването пада от 0,752 до нула. Корелацията между надеждността върху видимите задачи и надеждността върху скрити задачи е минус 0,90, тоест обратна: добър резултат там, където се настройва оценката, предсказва по-лош резултат другаде.


Второ изследване от 13 август подхожда от друга страна. Един и същ вече готов отговор, прекаран през допълнителен слой на предаване вместо направо, губи между 55,4 и 73,2 пункта успеваемост. При един от моделите видимата разлика от 3,6 пункта прикрива загуба от 64,3 пункта и компенсация от 60,7 пункта в обратната посока.


Оценка на AI модели: какво честно може да се твърди


Авторът на първото изследване сам поставя границата и тя заслужава да се повтори дословно: близката до нула разлика между агентите е твърдение за днешната популация от системи и за днешния начин на измерване, не за принципна липса на способност.


Това не е отхвърляне на измерването, а на единичното число. Оценка на AI модели остава полезна, когато е съставна и придружена от несигурността си, и подвежда, когато е една подредба с една цифра. Позицията, поддържана от Epoch AI, върви в същата посока: съставният показател носи повече информация от отделния тест, но никой скаларен индекс не може да представи многомерен профил без загуба.


Какво следва при избор на инструмент


Практическото следствие е просто и неудобно: класацията не замества собствения тест. Щом съвпадението между агент и задача обяснява повече от самия агент, единственият тест, който предсказва Вашия резултат, е този върху Вашите задачи.


За организация това означава подбор на десетина реални случая от собствената работа и пускане на двата или трите кандидата върху тях. За учащ означава нещо още по-евтино: инструментът, който води в класация за програмиране, може да е посредствен точно върху вида код, който пишете, и това се проверява за един следобед. Заслужава внимание и трети признак - как се държи инструментът, когато го включите в съществуващия си работен ред, а не когато работи сам в идеални условия. Второто изследване показва, че точно там изчезват най-много пунктове.


Заключение


Числото в класацията описва среща между конкретен модел и конкретен набор задачи, а не способност, която пътува. Затова две честни класации могат да дадат второ и 74-о място за един модел, и затова изборът се прави с проба, а не с подредба.


Помагаме на български организации и екипи да избират AI инструменти по собствени задачи, а не по чужди класации - с кратък сравнителен тест върху реални случаи. Услугите ни покриват одит, оценка на готовност, обучение на екипи и имплементация на специализирани AI автоматизации за всяка организация. Препоръчваме консултация при избор между няколко модела за конкретен работен процес, когато разликата в публичните резултати изглежда решаваща. [Свържете се с нас за консултация: academy@razvivai.se]


Източници



Този текст е създаден в съавторство с AI и е редактиран от екипа на РазвивAI се. Илюстрацията към публикацията е генерирана с AI.

Коментари


bottom of page