2226 статии от ICML минаха проверка за възпроизводимост
Конференцията ICML е сред най-важните в машинното обучение и тази година приема 6352 статии от близо 24 хиляди подадени. Обичайно никой не проверява дали резултатите в тях се повтарят, защото това е бавна и неблагодарна работа. През юли 1221 души пуснаха агенти да я свършат. Деветнадесет дни по-късно картината е едновременно по-добра и по-лоша от очакваното.

Какво представляваше проверката
Инициативата е на Hugging Face заедно с AlphaXiv и Gradio и върви от 15 юли до 2 август 2026 година. Участниците избират приета статия, пускат агент да възпроизведе описаните в нея опити и качват пълния дневник на изпълнението. Наградният фонд е скромен, 4000 долара в изчислителни кредити, а дневниците минават и през ръчен преглед, не само през автоматична оценка.
Под възпроизводимост се разбира друг екип да получи същия резултат, следвайки описанието в статията. В машинното обучение това е по-трудно, отколкото звучи: нужни са същите данни, същият код, същите настройки и достатъчно изчислителна мощност, а публикуваното описание рядко съдържа и четирите.
Новото тук е обхватът. 1221 участници публикуват 6816 дневника и се докосват до 2226 статии, тоест около 35% от всички приети на конференцията. За сравнение, институционалният подход към същия въпрос върви от 2018 година с човешки екипи, срокове от месеци и на порядък по-малко разгледани статии.
Какви са резултатите за възпроизводимост
Оценени са 35 908 отделни твърдения, от които 3978 са потвърдени. На ниво статия картината изглежда така: 266 статии са възпроизведени изцяло, 632 частично и без нито едно опровержение, а 49 статии излизат от проверката с всяко свое твърдение оборено.
Двете междинни категории заслужават повече внимание от крайните. 242 статии получават противоречиви присъди от различни екипи, тоест едни са ги потвърдили, а други са ги оборили. Още 502 имат доказателства само в умален мащаб, защото пълното повторение изисква изчислителен ресурс, с какъвто участникът не разполага. Голяма част от работата в машинното обучение не е нито потвърдена, нито оборена, а просто твърде скъпа за повторение.
Кой проверява проверяващия
Тук идва уговорката, без която числата подвеждат. Съдията, който отсъжда всяко отделно твърдение, сам е езиков модел. Един от участниците, Джъстин Джонсън, публикува собствен разбор и посочва, че по неговите данни три от всеки четири опровержения срещу неговия екип са били грешни.
Ако този дял важи по-широко, числото 49 напълно оборени статии се чете като горна граница, а не като установен факт. Валидно е и обратното: същата несигурност тежи и върху потвържденията. Автоматичен съдия, който греши в едната посока, най-вероятно греши и в другата.
Това не обезсмисля упражнението, а определя мястото му. Резултатът е карта на местата, които заслужават човешки поглед, а не заместител на самия човешки поглед.
Какво следва за човек, който чете научни твърдения
Практическият извод не е за изследователите, а за всеки, който взима решение по чужд резултат. Приета на конференция статия означава, че рецензенти са я сметнали за интересна, не че някой е повторил числата в нея. Тези две неща се смесват постоянно в новинарските преразкази, включително когато става дума за твърдения на производители.
Полезните въпроси са три: има ли публикувани код и данни, повторил ли ги е някой независим и на какъв мащаб. Отговорът „да, но само в умален мащаб" е различен от „да" и често означава, че основното твърдение остава непроверено.
Струва си да се добави и че цялата тази проверка тече върху статии, чиито автори са публикували материалите си доброволно. Работата, която остава изцяло затворена, не влиза в никаква подобна сметка, а именно там обикновено стоят твърденията на търговските доставчици за собствените им модели.
Заключение
Проверката на ICML 2026 не показва, че машинното обучение е несериозна наука. Показва нещо по-конкретно: досега почти никой не е гледал системно. Първият сериозен поглед намира едновременно 266 чисти потвърждения и 242 случая, в които два независими екипа не са съгласни какво изобщо се е случило.
Помагаме на български организации да проверяват твърденията за AI, преди да похарчат бюджет по тях, вместо да се доверяват на заглавието на изследването. Услугите ни покриват одит, оценка на готовност, обучение на екипи и имплементация на специализирани AI автоматизации за всяка организация. Препоръчваме консултация при избор на модел или доставчик по публикувани показатели. [Свържете се с нас за консултация: academy@razvivai.se]
Източници
ICML 2026 Open Reproductions - Hugging Face, август 2026
ICML 2026 Acceptance Rates and Submission Stats - OpenAccept, август 2026
AI Agents Take On a Challenge to Reproduce ICML 2026 Papers - HowAIWorks, юли 2026
Improving Reproducibility in Machine Learning Research - Journal of Machine Learning Research, 2021
Този текст е създаден в съавторство с AI и е редактиран от екипа на РазвивAI се. Илюстрацията към публикацията е генерирана с AI.




Коментари