top of page

Nemotron с отворени тегла, но карта за 5000 евро

13.08
време за четене: 3 мин.
Модел, който се сваля безплатно и работи на собствената машина, звучи като края на зависимостта от чужд облак. Съобщението на NVIDIA от 11 август обещава точно това. Сметката за влизане обаче не е в модела, а под бюрото.

Робот подава безплатен пакет на човек през тезгях, а човекът гледа надолу към огромна метална кутия на пода, която едва повдига с две ръце

Какво точно пусна NVIDIA


Nemotron 3.5 Lightning е модел с 30 милиарда параметъра, от които активни при всяка заявка са само 3 милиарда. Лицензът е OpenMDW, версия 1.1, а контекстният прозорец достига 1 милион токена. Заедно с модела компанията пусна и NeMo Switchyard - библиотека с отворен код, която насочва отделните заявки към различни модели според сложността им.


Обявените резултати са добри за този размер: 81,94 по MMLU Pro, 75,44 по GPQA Diamond и 51,56 по SWE-bench Verified. През платформата OpenRouter моделът се предлага за 0,05 долара за милион входни и 0,20 долара за милион изходни токена, което е порядък под цената на водещите затворени модели.


Едно уточнение в рекламните числа заслужава внимание. Обещаните до четири пъти по-бърза генерация се отнасят за скоростта на изхода, докато реалното ускорение при завършване на агентни задачи е 30%. Двете числа описват различни неща и в кратките отразявания се смесват.


Отворени тегла: какво значи това на практика


Определението отворени тегла означава, че моделът се сваля и работи в собствената инфраструктура, без данните да напускат организацията. За счетоводна кантора, лекарска практика или фирма с договорни задължения за поверителност това е реална разлика, а не подробност. Разговорът за поверителността се мести от доверие в чужд доставчик към контрол върху собствена машина, а това са различни по същество неща.


Практическият праг обаче е хардуерът. Официалното изискване в картата на модела е видеокарта от сървърен клас с 80 гигабайта памет. На потребителска машина моделът тръгва с четирибитова квантизация върху RTX 5090, но заема почти цялата ѝ памет при среден контекст. Тази карта се предлага в Европа за до над 4000 евро при силно ограничена наличност, което превръща безплатния модел в инвестиция от порядъка на едно работно място.


Измерената скорост на такава машина е между 123 и 138 токена в секунда - добро число, но под очакванията, които оставя съобщението. Към сметката се добавят и разходите, които рядко се броят предварително: електричество при постоянно натоварване, охлаждане и човек, който да поддържа всичко това. Собственият хостинг не премахва разхода, а го премества от месечна сметка в еднократна инвестиция плюс труд.


Какво показа независимата проверка


Тук е най-полезната част, защото почти всички обявени резултати са вътрешни измервания на самата NVIDIA върху нейни собствени тестови среди.


Единственият независим тест на маршрутизирането е на LangChain, върху 145 многоходови задачи. Резултатите: Nemotron сам се справя с 77,7% от тях за 0,72 долара; водещ затворен модел постига 86,0% за 11,45 долара; при маршрутизиране резултатът е 80,0% за 3,00 долара, като малкият модел поема 93% от извикванията срещу 10,4% от разхода.


Спестяването е истинско, но не е безплатно: цената му са шест точки по-ниска точност, а не запазено качество, както подсказва рекламната формулировка. Самите автори на теста уточняват, че това е измерване на едно натоварване, а не прогноза за чуждо, и че разсейването между отделните пускания е високо.


Втората уговорка е за подбудите. NVIDIA не печели от модела, а от картите. Безплатен модел, който работи най-добре върху нейния хардуер, е форма на реклама и това не го прави лош, но обяснява защо сравненията са направени точно така.


Полезният прочит на теста не е кой модел печели, а че разпределянето на заявките по сложност е отделно умение със собствена цена. Организация, която иска да плаща по-малко, не избира просто по-евтин модел, а решава кои задачи заслужават скъпия. Тази преценка не идва наготово с библиотеката и остава човешка работа.


Заключение


Отворените тегла свалят зависимостта от чужд облак и я заменят със зависимост от чужд хардуер. За организация с изискване данните да останат вътре сметката излиза; за всички останали абонаментът засега е по-евтин.


Помагаме на български организации да преценят кога собственият хостинг на AI модел се оправдава и кога абонаментът остава по-разумният избор. Услугите ни покриват одит, оценка на готовност, обучение на екипи и имплементация на специализирани AI автоматизации за всяка организация. Препоръчваме консултация при работа с данни, които не могат да напускат организацията. [Свържете се с нас за консултация: academy@razvivai.se]


Източници



Този текст е създаден в съавторство с AI и е редактиран от екипа на РазвивAI се. Илюстрацията към публикацията е генерирана с AI.

Коментари


bottom of page