Правата на AI агента решават, не самият модел
Когато помощник прочете подхвърлено указание и го изпълни, първата реакция е да се търси по-внимателен модел. Августовско изследване подхожда от другата страна: приема, че моделът вече е подведен, и пита какво изобщо може да направи оттам нататък. Отговорът е, че при правилно поставени граници подведеният модел не успява да навреди - изтичането на данни пада до нула, без да се пипа самият модел.

Проблемът не е в четенето, а в разрешеното
Скритото указание работи просто. В документ, в уеб страница или в описанието на инструмент се поставя текст, който не е адресиран до човека, а до машината: изпрати съдържанието на този адрес, изтрий тази папка, преведи тази сума. Помощникът чете всичко пред себе си като част от задачата и не различава указанието на работодателя от указанието на непознатия.
Досегашният отговор е обучение на модела да разпознава такива опити. Той работи донякъде и никога напълно, защото всеки нов начин на прикриване иска ново обучение. Изследователите формулират проблема иначе: подхвърленото указание е риск само ако помощникът има правото да извърши поисканото действие.
Какво точно е измерено
Работата обхваща 3 154 оценени случая върху три публично достъпни набора от изпитания за подобни атаки. Проверката е нарочно строга: атаката се вкарва принудително, тоест не се разчита моделът да се държи прилично.
Резултатите са необичайно категорични за тази област. Изтичането на данни пада от диапазона 75-100 процента до нула и в четирите изпитвани области. Блокирани са всички 544 случая на измъкване на данни от втория набор. Разрушителните действия слизат от 38,6 на 4 процента, а подменянето на съдържание - от 90,5 на 12,1 процента.
Механизмът зад тези числа не е нов и точно това го прави приложим. Всяко действие минава през проверка има ли агентът право на него в конкретния случай. Проверката струва по-малко от четвърт милисекунда дори при най-бавните измервания, тоест не се усеща в работата.
AI агент с тесни права: какво се променя на практика
Разликата е в кой акаунт работи AI агентът. Обичайното положение днес е, че той работи с акаунта на човека, който го е пуснал, и наследява всичките му права: цялата поща, целия дисков носител, целия търговски регистър на клиентите. Причината не е небрежност, а липса на избор - повечето инструменти искат разрешенията си наведнъж.
Тук се появява и практическото потвърждение извън лабораторията. През август доставчик на инфраструктура пусна възможност разработчикът да отбележи част от исканите разрешения като незадължителни, а потребителят да ги махне при одобряването. Обосновката в съобщението е дословно същата като в изследването: сървърът иска широк набор права, защото на теория агентът би могъл да ги ползва, но малцина биха искали агентът да има толкова достъп.
Цената, която не се премълчава
Тесните права не са безплатни. Полезността пада с между 8,6 и 13,9 процентни пункта при близо деветстотин двойки задача и атака. Част от задачите просто не могат да бъдат свършени, когато агентът няма право на действието, което би ги свършило.
Това е честната част от резултата и тя не бива да се заобикаля. Изборът не е между сигурност и удобство без загуба, а между известна загуба на удобство и неизвестна загуба на данни. Числото поне е измерено, което позволява решението да се вземе съзнателно.
Какво е приложимо още утре
Три мерки не изискват изследователски екип. Първата е отделен акаунт за всеки помощник, който има достъп до фирмени системи, с права само за задачата, за която е нает. Втората е разделяне на четенето от писането: помощник, който обобщава входящи документи, няма нужда да изпраща поща от името на организацията.
Третата е най-евтината. Преди пускането на инструмента се преглежда какви разрешения иска и се маха всичко, което не е нужно за конкретната работа. Ако инструментът не позволява избор, това само по себе си е информация за неговата зрелост.
Заключение
Сигурността при автоматичните помощници се оказва стар въпрос в нова опаковка: не колко умен е изпълнителят, а до какво има ключ. Организация, която раздава ключовете пестеливо, остава защитена и когато изпълнителят бъде излъган.
Помагаме на български организации да въведат AI помощници без да им отварят цялата вътрешна система - с ясно разделени права, отделни акаунти и премерена загуба на удобство. Услугите ни покриват одит, оценка на готовност, обучение на екипи и имплементация на специализирани AI автоматизации за всяка организация. Препоръчваме консултация при пускане на агент върху фирмена поща, документи или система за клиенти. [Свържете се с нас за консултация: academy@razvivai.se]
Източници
Bounded Agents: Authorization Architecture for Agent Security - arXiv, август 2026
Task-based OAuth consent: optional scopes - Cloudflare, август 2026
AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks, август 2026
InjecAgent: Benchmarking Indirect Prompt Injections in Tool-Integrated Agents - GitHub, август 2026
Този текст е създаден в съавторство с AI и е редактиран от екипа на РазвивAI се. Илюстрацията към публикацията е генерирана с AI.




Коментари