Отворен модел за модерация от Mistral, но не на български
Френската Mistral пусна на 4 август модел за проверка на съдържание с три милиарда параметъра и отворени тегла, който върви на една видеокарта с 16 GB. Сред дванадесетте езика, за които е обучен и измерен, българският не присъства.

Правилата се задават в момента на заявката
Досегашните инструменти за модерация носят списък с категории вреда, зашит при обучението. Shieldstral работи иначе: при всяка заявка получава указание за контекста и строгостта, въпрос с отговор „да" или „не" и съдържанието за оценка. Връща един токен и калибрирана оценка, без преобучение.
Разликата има практическа стойност. Организация, която иска да отсее нещо специфично за своята дейност, го описва с изречение вместо да преобучава модел. Обратната страна е, че отговорността за формулировката се измества изцяло върху внедрителя: зле написано правило означава пропуснато съдържание.
Лицензът е Apache 2.0, тоест търговската употреба е разрешена без такса и без отделно споразумение. Видеокарта с 16 GB се намира у нас в порядъка на 430 до 545 евро, което прави входната цена за хардуер по-скоро въпрос на решение, отколкото на бюджет. Самата машина, токът и поддръжката остават извън тази сметка.
Числата са на производителя и още не са проверени
Обявените резултати изглеждат силно: среден F1 от 84,9% при текст, наравно с отворен конкурент до седем пъти по-голям, и 83,8% при изображения. Две уточнения обаче променят картината.
По адаптивност към непознати категории Shieldstral отчита 91,3% срещу 94,1% за същия по-голям конкурент. Тоест показателят, който се цитира като силна страна, всъщност е изоставане.
Второто число, което циркулира, е ръст от 23,3 процентни пункта при добавяне на синтетични обучаващи данни. То е вярно, но идва от вътрешен експеримент на самата компания, при който вариантът само с публични данни постига 61,1%, а с добавените генерирани примери стига 84,4%. Не е превъзходство над конкурент.
Общата уговорка е по-важна от отделните числа: всички измервания са на производителя, по избрани от него тестове, а моделът е на два дни. Независима репродукция засега няма.
Защо липсата на български не е подробност
Дванадесетте езика са английски, френски, испански, немски, италиански, португалски, нидерландски, китайски, японски, корейски, арабски и руски. Освен руския няма нито един славянски език и нито един език от Централна и Източна Европа.
Базовият модел е многоезичен, така че инструментът вероятно ще върне някакъв резултат и на български. Гаранция за качеството обаче няма, защото няма и измерване. Самата документация на модела признава неравномерно покритие по езици и посочва по-слаби резултати на арабски и индонезийски, тоест на езици, които са в официалния списък. Очакванията за език извън него трябва да са съответно ниски.
Практическият извод за българска организация е конкретен. Преди внедряване се прави собствена проверка върху реални български текстове от съответната дейност, с измерен дял на пропуснатото и на излишно блокираното. Без това числата от обявата не означават нищо за българско съдържание.
Какво не решава един модел за модерация
Такива инструменти не са решен проблем, а компромис между два вида грешка. Изследване на класа показва разтегливостта: един модел блокира едва 0,4% от безобидните заявки, но пропуска 88,1% от вредните, докато друг пропуска само 12,5% от вредните, но спира 25,7% от нормалните. Никой не се справя добре и по двата показателя едновременно.
Мащабът на втория вид грешка се вижда при пресмятане. Филтър с 4% излишно блокиране спира 40 000 законни заявки на всеки милион, а служителите, срещнали такава стена, отиват към лични профили и данните излизат по друг път.
Струва си да се разграничи и едно объркване. Задължението за маркиране на генерирано съдържание по член 50 от европейската рамка изисква машинночетим знак, че текстът или изображението са създадени от машина. Класификаторът за безопасност преценява друго - дали съдържанието е вредно. Двете задължения не се покриват.
Заключение
Отворените тегла и разрешителният лиценз свалят цената на входа, но не свалят задължението да се измери качеството върху собствените данни. За български текст това измерване още не е направено от никого.
Помагаме на български организации да преценят кои отворени модели вършат работа на български и какво трябва да се измери, преди да се разчита на тях. Услугите ни покриват одит, оценка на готовност, обучение на екипи и имплементация на специализирани AI автоматизации за всяка организация. Препоръчваме консултация при екипи, които обмислят собствена инфраструктура за проверка на съдържание. [Свържете се с нас за консултация: academy@razvivai.se]
Източници
Shieldstral - Mistral AI, август 2026
Shieldstral-1.0-3B model card - Hugging Face, август 2026
Benchmarking guardrail models for over-refusal and harm detection - arXiv, ноември 2025
Mistral's open model Shieldstral matches much larger safety models - The Decoder, август 2026
Mistral's Shieldstral packs policy-adaptive safety screening into 3B parameters - Unite.AI, август 2026
Comparing LLM guardrails across GenAI platforms - Unit 42, Palo Alto Networks, 2026
Article 50: Transparency Obligations - AI Act Explorer, 2026
Този текст е създаден в съавторство с AI и е редактиран от екипа на РазвивAI се. Илюстрацията към публикацията е генерирана с AI.




Коментари