Двойно сляпа оценка: кой проверява AI моделите
Класациите на езиковите модели се четат като обективно измерване и рядко се пита кой всъщност е държал изпита. Пилотен проект на Google DeepMind с четири външни организации предлага различна подредба. Резултатът е схема, при която нито проверяващият вижда модела, нито създателят му вижда въпросите.

Проблемът е в замърсените еталони
Всяка класация на модели стъпва на набор от тестови въпроси. Ако тези въпроси са попаднали в обучаващите данни, високият резултат вече не мери способност, а памет. Сравнението е с ученик, който е надникнал в изпитните теми предварително.
Явлението е известно и добре описано, а неудобството му е двустранно. Създателят на модела няма как да докаже, че не е виждал въпросите, а външният оценител няма как да провери, без да получи достъп до самия модел. Обичайният изход е взаимно доверие, а то не е метод за измерване.
Как работи двойно сляпа оценка
Схемата решава задачата с техника, не с обещания. При двойно сляпа оценка моделът и тестовите въпроси се срещат вътре в защитена изчислителна среда, до която нито едната страна няма поглед.
Конкретно: използвана е поверителна виртуална машина с криптиране на паметта на самия процесор и графичен ускорител, работещ в същия поверителен режим. Оркестрацията е с PySyft на OpenMined, а тестван е моделът Gemini 2.5 Flash Lite. Оценителят не вижда теглата на модела, а Google не вижда подадените въпроси.
Въпросите идват от резервирано подмножество на еталона AILuminate на MLCommons, за което организацията заявява, че никой модел на Google DeepMind не го е срещал преди. Проверяваните области включват химични, биологични, радиологични, ядрени и взривни опасности, кибератаки, реч на омразата, самонараняване и подбуждане към насилие.
Участниците определят пилота като първия по рода си в света. Уточнението е нужно: подобна схема е изпробвана още през 2024 г. от Anthropic и британския институт за безопасност, но с публично достъпен модел и публичен набор от данни. Новото тук е, че и моделът, и еталонът са реални и закрити.
Какво липсва: самите резултати
Тук идва най-съществената уговорка и тя не бива да се подминава. Публикувана е методиката, но не и оценките. В техническия доклад няма нито едно число за безопасност.
Оценителят AVERI посочва къде са отишли числата: подготвен е поверителен доклад до Google DeepMind, който описва наблюдаваните успехи и начини на отказ и съдържа количествените резултати, докато самите въпроси и отговори остават закрити.
Ограниченията са признати и от самия доклад. Не целият използван код е бил проверим за външната страна, изграждането на средата не е независимо възпроизводимо, а Google остава част от веригата на проверката. Формулировката в документа е показателна: доверието към Google се увеличава, вместо да отпадне.
Защо това има значение при избора на инструмент
За организация или специалист, който избира между модели, поуката е практична и приложима веднага.
Числото в класация без обявено потекло на въпросите носи ограничена информация. Че една и съща система може да се нареди втора при едно измерване и седемдесет и четвърта при друго, показа по-ранна наша новина. Полезният въпрос към доставчика не е какъв резултат е постигнал моделът, а кой е съставил теста и кой е имал достъп до него. Разликата между двете е разликата между реклама и проверка.
Заслужава внимание и посоката. Ако тази схема се утвърди, независимата проверка на закрити модели става технически възможна, без създателят да разкрива интелектуалната си собственост. Това е предпоставка и за регулаторен надзор, който днес опира до същото препятствие.
Дотогава разумният подход остава непроменен: собствено изпитване върху собствени задачи. Еталонът показва общо поведение, а работата на конкретната организация не е общо поведение.
Заключение
Проектът е по-скоро доказателство, че независима проверка на закрит модел е осъществима, отколкото твърдение за качеството на конкретен модел. Ценното в него е методът, а не оценката, която така и не беше публикувана, и точно затова си струва да се следи какво ще последва.
Помагаме на български организации да изпитват AI модели върху собствените си задачи, вместо да избират по класации с неясен произход. Услугите ни покриват одит, оценка на готовност, обучение на екипи и имплементация на специализирани AI автоматизации за всяка организация. Препоръчваме консултация при избор на модел за процес, в който грешката има измерима цена. [Свържете се с нас за консултация: academy@razvivai.se]
Източници
Piloting the world's first double-blind AI evaluations - Google DeepMind, 27 август 2026
Double-blind evaluations technical report - Google DeepMind, август 2026
Double-blind evaluation of a frontier AI model - OpenMined, август 2026
AVERI pilot report: the world's first double-blind eval - AVERI, август 2026
Double-blind reliability evaluation - MLCommons, август 2026
Google DeepMind tests Gemini in double-blind evaluation - TechRepublic, август 2026
Google's double-blind evaluation - The New Stack, август 2026
Този текст е създаден в съавторство с AI и е редактиран от екипа на РазвивAI се. Илюстрацията към публикацията е генерирана с AI.




Коментари