top of page

Двойно сляпа оценка: кой проверява AI моделите

2.09
време за четене: 3 мин.
Класациите на езиковите модели се четат като обективно измерване и рядко се пита кой всъщност е държал изпита. Пилотен проект на Google DeepMind с четири външни организации предлага различна подредба. Резултатът е схема, при която нито проверяващият вижда модела, нито създателят му вижда въпросите.

Робот с превръзка на очите и жена с превръзка на очите пускат по един запечатан плик в заключено стъклено сандъче между тях, а трети човек с празен бележник чака отстрани и не получава нищо

Проблемът е в замърсените еталони


Всяка класация на модели стъпва на набор от тестови въпроси. Ако тези въпроси са попаднали в обучаващите данни, високият резултат вече не мери способност, а памет. Сравнението е с ученик, който е надникнал в изпитните теми предварително.


Явлението е известно и добре описано, а неудобството му е двустранно. Създателят на модела няма как да докаже, че не е виждал въпросите, а външният оценител няма как да провери, без да получи достъп до самия модел. Обичайният изход е взаимно доверие, а то не е метод за измерване.


Как работи двойно сляпа оценка


Схемата решава задачата с техника, не с обещания. При двойно сляпа оценка моделът и тестовите въпроси се срещат вътре в защитена изчислителна среда, до която нито едната страна няма поглед.


Конкретно: използвана е поверителна виртуална машина с криптиране на паметта на самия процесор и графичен ускорител, работещ в същия поверителен режим. Оркестрацията е с PySyft на OpenMined, а тестван е моделът Gemini 2.5 Flash Lite. Оценителят не вижда теглата на модела, а Google не вижда подадените въпроси.


Въпросите идват от резервирано подмножество на еталона AILuminate на MLCommons, за което организацията заявява, че никой модел на Google DeepMind не го е срещал преди. Проверяваните области включват химични, биологични, радиологични, ядрени и взривни опасности, кибератаки, реч на омразата, самонараняване и подбуждане към насилие.


Участниците определят пилота като първия по рода си в света. Уточнението е нужно: подобна схема е изпробвана още през 2024 г. от Anthropic и британския институт за безопасност, но с публично достъпен модел и публичен набор от данни. Новото тук е, че и моделът, и еталонът са реални и закрити.


Какво липсва: самите резултати


Тук идва най-съществената уговорка и тя не бива да се подминава. Публикувана е методиката, но не и оценките. В техническия доклад няма нито едно число за безопасност.


Оценителят AVERI посочва къде са отишли числата: подготвен е поверителен доклад до Google DeepMind, който описва наблюдаваните успехи и начини на отказ и съдържа количествените резултати, докато самите въпроси и отговори остават закрити.


Ограниченията са признати и от самия доклад. Не целият използван код е бил проверим за външната страна, изграждането на средата не е независимо възпроизводимо, а Google остава част от веригата на проверката. Формулировката в документа е показателна: доверието към Google се увеличава, вместо да отпадне.


Защо това има значение при избора на инструмент


За организация или специалист, който избира между модели, поуката е практична и приложима веднага.


Числото в класация без обявено потекло на въпросите носи ограничена информация. Че една и съща система може да се нареди втора при едно измерване и седемдесет и четвърта при друго, показа по-ранна наша новина. Полезният въпрос към доставчика не е какъв резултат е постигнал моделът, а кой е съставил теста и кой е имал достъп до него. Разликата между двете е разликата между реклама и проверка.


Заслужава внимание и посоката. Ако тази схема се утвърди, независимата проверка на закрити модели става технически възможна, без създателят да разкрива интелектуалната си собственост. Това е предпоставка и за регулаторен надзор, който днес опира до същото препятствие.


Дотогава разумният подход остава непроменен: собствено изпитване върху собствени задачи. Еталонът показва общо поведение, а работата на конкретната организация не е общо поведение.


Заключение


Проектът е по-скоро доказателство, че независима проверка на закрит модел е осъществима, отколкото твърдение за качеството на конкретен модел. Ценното в него е методът, а не оценката, която така и не беше публикувана, и точно затова си струва да се следи какво ще последва.


Помагаме на български организации да изпитват AI модели върху собствените си задачи, вместо да избират по класации с неясен произход. Услугите ни покриват одит, оценка на готовност, обучение на екипи и имплементация на специализирани AI автоматизации за всяка организация. Препоръчваме консултация при избор на модел за процес, в който грешката има измерима цена. [Свържете се с нас за консултация: academy@razvivai.se]


Източници



Този текст е създаден в съавторство с AI и е редактиран от екипа на РазвивAI се. Илюстрацията към публикацията е генерирана с AI.

Коментари


bottom of page