750 токена в секунда: OpenAI пусна Ultrafast
Обичайният начин да се направи един езиков модел по-полезен е да се направи по-умен. OpenAI обяви нещо друго: същият модел, но четиринадесет пъти по-бърз. Скоростта се оказва отделно свойство, а не страничен ефект.

Какво представлява Ultrafast
На 13 август 2026 OpenAI обяви Ultrafast - нов сервизен клас в интерфейса за програмисти, който върти модела GPT-5.6 Sol върху хардуер на компанията Cerebras. Достъпът засега е ограничен преглед за избрани клиенти, а цена не е обявена.
Числото, което носи новината, е скоростта на произвеждане на текст. Обичайната услуга дава около 53 изходни токена в секунда, а Ultrafast стига до 750 - до четиринадесет пъти повече при същия модел и без обявено влошаване на качеството. Самата Cerebras посочва и по-предпазлив показател: 5,6 пъти ускорение от край до край при измерване с GDP-Val, тоест върху цяла задача, а не върху гола генерация.
Токен е парченце текст, приблизително между сричка и къса дума. Петдесет и три токена в секунда е малко по-бързо от бърз машинописец. Седемстотин и петдесет е скорост, при която цял абзац се появява наведнъж.
Защо 750 токена в секунда променят кои приложения са възможни
Разликата не е в удобството. Тя е в това кои приложения изобщо имат смисъл да се строят.
При петдесетина токена в секунда асистентът е нещо, което се чака. Това е приемливо, когато човек пише запитване и отива да свърши друго. Става непоносимо, когато отговорът трябва да влезе в течащ разговор с клиент по телефона, в анализ, който се обновява, докато операторът говори, или във верига от няколко последователни повиквания към модела, където всяко чака предишното.
Забавянето е причината голяма част от днешните AI приложения да са диалогови прозорци, а не невидими стъпки вътре в работещ процес. Когато отговорът излиза за част от секундата, моделът може да бъде поставен там, където досега стоеше проста заявка към база данни.
За организация с обслужване на клиенти това е разликата между инструмент, който помага на оператора след разговора, и инструмент, който работи по време на него. Ефектът е още по-силен при вериги от агенти, където десет последователни повиквания превръщат едносекундно забавяне в десетсекундно.
Откъде идва скоростта
Ускорението не е софтуерна оптимизация и не е нов модел. То е следствие от друг вид чип.
Cerebras прави процесори по подхода Wafer-Scale Engine: вместо от една силициева пластина да се нарежат стотици отделни чипове, цялата пластина остава един чип. Резултатът е 44 гигабайта свръхбърза памет от типа SRAM директно върху процесора.
Значението на това число е конкретно. При обичайните ускорители теглата на модела живеят в отделна памет и трябва да бъдат прочитани отново за всеки следващ токен, а тесното място е пътят между паметта и изчислението, не самото изчисление. Когато теглата се побират върху самия чип, това пътуване отпада и скоростта престава да зависи от пропускателната способност на паметта.
Нашият екип отбелязва един по-широк извод, който си струва да се задържи. Публичният разговор мери напредъка в размер на модела и в резултати от изпитания. Този случай показва, че архитектурата на хардуера решава не колко е умен моделът, а къде може да бъде поставен.
Какво все още не се знае
Съобщението оставя отворени точно въпросите, които решават дали технологията става достъпна.
Цена не е обявена, а тя е определящата променлива. Wafer-Scale чиповете са скъпи за производство и досега се срещаха в специализирани центрове, не в масова услуга. Възможно е Ultrafast да е клас за клиенти с голям обем, а не опция, която малка фирма включва с превключвател.
Не е обявен и капацитет. Ограниченият преглед за избрани клиенти обикновено означава, че наличният хардуер не стига за всички, а разширяването зависи от производство, което не се мащабира бързо.
За организация, която планира разходи, разумният подход е скоростта да се третира като предстояща възможност, а не като заложено условие в бюджета за следващата година. Струва си обаче процесите да бъдат описани отсега така, че да могат да поемат бърз отговор, когато цената стане известна.
Заключение
Ускорение от четиринадесет пъти при същия модел премества изкуствения интелект от прозорец, в който се чака, към стъпка вътре в работещ процес. Кога това ще е достъпно и на каква цена остава необявено.
Помагаме на български организации да преценят кои процеси печелят от бърз AI отговор и кои изобщо не зависят от скоростта. Услугите ни покриват одит, оценка на готовност, обучение на екипи и имплементация на специализирани AI автоматизации за всяка организация. Препоръчваме консултация при проектиране на обслужване на клиенти или вериги от автоматични стъпки, в които забавянето се натрупва. [Свържете се с нас за консултация: academy@razvivai.se]
Източници
Accelerating GPT-5.6 Sol Ultrafast with OpenAI - Cerebras, август 2026
OpenAI introduces Ultrafast, a new mode that makes GPT-5.6 Sol work at 14x the speed - TechCrunch, август 2026
Previewing Ultrafast - OpenAI, август 2026
Cerebras Powers Ultrafast Mode for OpenAI's GPT-5.6 Sol - GlobeNewswire, август 2026
OpenAI previews Ultrafast GPT-5.6 Sol running up to 14 times faster - 9to5Mac, август 2026
Този текст е създаден в съавторство с AI и е редактиран от екипа на РазвивAI се. Илюстрацията към публикацията е генерирана с AI.




Коментари