MLPerf Client 2.0 започва да мери агентни задачи
Магазините вече продават компютри с обещание за производителност при изкуствен интелект, а купувачът обикновено получава едно число и никакъв начин да го провери. На 18 август MLCommons пусна втората версия на своя безплатен еталон за персонални машини. За първи път се измерва не само колко бързо мисли моделът, а колко време минава, докато задачата наистина приключи.

Какво ново има във версия 2.0
Досегашният еталон покриваше основно езикови модели: подаваш заявка, мериш скоростта на отговора. Новата версия добавя две категории, каквито дотук нямаше.
Първата е генериране на изображения. Ползва се моделът Flux 2 Klein 4B при размер 1024 на 1024 точки, а тестът пуска четири различни заявки по четири изображения всяка, за да наподоби реална употреба, а не единичен кадър. Категорията е обозначена като експериментална.
Втората е агентният режим. Тук се симулират два сценария от истинската работа - софтуерен инженер и анализатор на данни - вместо изкуствено измислена задача с предвидим отговор.
Защо агентни задачи се мерят различно
Разликата не е козметична. При обикновена заявка към езиков модел цялото време минава в самия модел, затова и старият показател беше достатъчен.
Агентът работи иначе. Той мисли, после извиква инструмент, изчаква резултата, мисли пак и така няколко пъти. Новият еталон отчита пълното време от край до край и дава разбивка между извода на модела и изпълнението на инструментите. При агентни задачи тясното място често изобщо не е моделът, а дискът, паметта или самият инструмент - и това се вижда чак когато двете времена се измерят поотделно.
Точно това обяснява защо машина с внушителни числа на кутията може да върши агентната работа бавно.
Какво се променя при езиковите модели
Основната част също е обновена. Езиковият тест минава от Phi 3.5 mini на Phi 4 Mini Instruct, а като новост се добавя експерименталният Qwen 3 8B. Базовият модел остава Llama 3.1 8B Instruct, за да се пази съпоставимостта с предишни измервания.
Обновена е и самата задача: добавя се резюмиране при вход от 4000 жетона, а част от резултатите вече се искат в структуриран вид, а не като свободен текст. Дългият вход е важен, защото натоварва паметта по съвсем различен начин от кратката заявка, а именно дългият вход описва ежедневната работа с документи.
Едно уточнение спестява объркване при четене на съобщенията. По-големият модел Phi 4 Reasoning с 14 милиарда параметъра не е нова добавка - той съществуваше и в първата версия, а сега е преместен в разширената категория. Единственият наистина нов езиков модел е Qwen 3 8B.
Поддържат се машини на пет производителя - AMD, Intel, NVIDIA, Qualcomm и Apple - като списъкът обхваща както видеокарти от няколко поколения назад, така и вградените ускорители в новите преносими компютри. Тоест еталонът не изисква купуване на най-скъпото, за да покаже нещо смислено. Самият той е безплатен, а изходният му код е публичен и подлежи на проверка.
Какво значи това при покупка на техника
Практическата стойност е конкретна. Български фирми, училища и самостоятелни специалисти вече купуват машини заради обещание за изкуствен интелект, но нямаха независим и безплатен начин да го проверят на собствения си хардуер.
Две уговорки обаче са задължителни. Първата: към момента няма публикувана класация между машини - това е инструмент за измерване, не готова таблица с победители. Втората, по-важната: MLCommons е отраслов консорциум, а сред участниците в него са самите производители на хардуер, което не обезсилва измерването, но обяснява защо то мери онова, което отрасълът е готов да мери.
Разумният подход е еталонът да се пусне върху конкретната конфигурация преди поръчка на по-голямо количество, а не да се разчита на общо число от описанието.
Заключение
Значението на тази версия не е в новите модели, а в смяната на въпроса. Досега се питаше колко бърз е моделът, а отсега нататък може да се пита колко време отнема задачата. Второто е единственото, което купувачът реално усеща.
Помагаме на български организации да превърнат неясните обещания за производителност в проверими числа върху собствената им техника. Услугите ни покриват одит, оценка на готовност, обучение на екипи и имплементация на специализирани AI автоматизации за всяка организация. Препоръчваме консултация при подготовка на по-голяма поръчка за компютри, при избор между локален и облачен модел или при планиране на агентни работни потоци. [Свържете се с нас за консултация: academy@razvivai.se]
Източници
Този текст е създаден в съавторство с AI и е редактиран от екипа на РазвивAI се. Илюстрацията към публикацията е генерирана с AI.




Коментари