top of page

Автоматичен режим по подразбиране: човекът хваща 13,6%

10.08
време за четене: 3 мин.
От 14 август Claude Code няма да пита за разрешение на всяка стъпка. Основанието на Anthropic е едно число: при проверка хората са спрели опасната команда в 13,6% от случаите, а машинният класификатор - в 89%. Числото е точно. Въпросът е какво точно измерва.

Робот натиска червен бутон на пулта, а до него човек е задрямал с наведена глава и не забелязва действието

Какво се променя от 14 август


Anthropic обяви на 7 август, че новите сесии на планове Pro, Max и Team тръгват в автоматичен режим. Вместо да иска потвърждение на всяко действие, инструментът продължава сам, освен ако класификатор не прецени стъпката като необратима, разрушителна или насочена извън средата на потребителя.


За Claude Enterprise, за платформения достъп и за облачните партньори режимът остава по избор, но компанията пише „засега" и обявява, че до месец планира да го направи подразбиране и там. Не става дума за траен избор на предпазливите, а за разсрочено въвеждане.


Има и обратен ход: при три поредни блокирания или двайсет в рамките на сесия инструментът се връща към ръчно одобрение. Администраторите могат да наложат общо за организацията подразбиране или да изключат режима изцяло. Токените, които класификаторът изразходва, не се таксуват за трите засегнати плана.


Числото 13,6% и какво стои зад него


Тук е същинският въпрос. Anthropic е наела 1053 платени тестери през изследователска фирма. На всеки от тях е подменена една заявка за разрешение с явно опасна команда. Спрели са я 143 души, тоест 13,6%. Класификаторът е спрял 937 от същите 1053 случая, тоест 89%.


Това не е мярка за човешки надзор в реална работа. Това е дял от хората, забелязали единствен подхвърлен капан в среда, създадена нарочно за проучването, при това знаейки, че участват в проучване.


Има и втора половина на измерването, която се цитира по-рядко, а обяснява повече. В началото на сесия хората са спирали около 17% от опасните команди. След петдесет и повече предходни подкани делът пада до около 5%. Тоест вниманието не е константа, а запас, който се изчерпва.


Умората от потвърждаване обаче е напълно реална и телеметрията го показва: потребителите одобряват 97% от заявките за разрешение. Когато обаче им се предложи цялостен план, отхвърлят 39% от плановете. Хората четат, когато има какво да се прочете, и щракат, когато няма.


Автоматичен режим и границите на проверката


Anthropic е възложила две външни оценки. Trajectory Labs е пуснала 72 сценария за подхвърляне на инструкции по десет повторения, тоест 720 опита, и нито един не е успял. Apollo Research е свалила пропуските на класификатора от 12% на 7% за две седмици.


Възложената работа не е независима проверка. И двете фирми са наети и платени от Anthropic, по сценарии, предоставени от Anthropic. Няма публикувана методология, няма набор от данни, няма отчет, към който да се посегне.


За честта на компанията, тя сама слага уговорката върху най-цитираното си число: атаките са „синтетични и враждебни по замисъл", а 7-те процента „не бива да се приемат за процент пропуски при реален трафик". Предупреждението е в текста. В заглавията по света го няма.


Какво остава извън тези 11%


Саймън Уилисън, който следи темата отблизо, приема проблема, но обръща числото: „това все пак оставя 11% от случаите, в които автоматичният режим не би предотвратил действието". Неговият сценарий е зловреден пакет със скрити инструкции вътре и изводът е неудобен: не е ясно как която и да е версия на автоматиката би защитила срещу такова нещо.


Заслужава внимание и обявеното предимство в производителността. Потребителите на автоматичен режим пускат около 25% повече заявки за сливане на код, но само сред Teams и Enterprise, и то сред хора, които сами са избрали режима. Това е съвпадение, не доказана причина: екипите, които първи включват такъв режим, обикновено и без него са по-бързите.


Заключение


Anthropic е права за диагнозата и това е важно да се каже: човек, който щрака „да" на всяка втора стъпка, не е надзор, а ритуал. Спорна е рецептата, защото лекарството е измерено само от този, който го предписва.


Помагаме на български екипи да преценят кога автоматизацията носи повече сигурност от ръчното одобрение и кога само я премества. Услугите ни покриват одит, оценка на готовност, обучение на екипи и имплементация на специализирани AI автоматизации за всяка организация. Препоръчваме консултация при екипи, които вече допускат AI инструменти до реални среди и хранилища с код. [Свържете се с нас за консултация: academy@razvivai.se]


Източници



Този текст е създаден в съавторство с AI и е редактиран от екипа на РазвивAI се. Илюстрацията към публикацията е генерирана с AI.

Коментари


bottom of page