Независимо измерване: 48% отпадат при филтрите
Представата какво правят хората с езиковите модели се формира почти изцяло от отчетите на компаниите, които ги произвеждат. Изследователски консорциум реши да провери какво остава извън тези отчети. Приложен върху корпус от доброволно споделени разговори, професионалният филтър на един от доставчиците отсява 47,9% от съдържанието - и отпадналото не е случайна извадка.

Как е събран корпусът
Наборът обхваща 24 521 разговора и 92 493 реплики от над петдесет различни модела, събрани между 2023 и 2026 година от около пет хиляди потребители. Източниците са седем вече съществуващи набора, при които потребителят сам е споделил разговора си или изрично се е съгласил той да бъде използван.
Това е и основната ценност на работата. Отчетите на доставчиците стъпват върху вътрешни данни, които никой отвън не може да провери или възпроизведе. Тук материалът е публичен, а методът - описан достатъчно, за да бъде повторен от друг екип с други допускания.
Работата е дело на широк състав от близо двайсет автори от няколко университета, а етикетите върху разговорите са проверени повторно с втори модел, за да се намали влиянието на един-единствен подход при категоризирането.
Ограничението е също толкова ясно и авторите не го крият: хора, които публикуват разговорите си, не са представителна извадка от всички потребители. Затова и изводите се отнасят до този корпус, а не до цялото население от потребители.
Какво отсява филтърът
Изследователите вземат филтъра, с който една от компаниите отделя професионалната употреба за своя икономически индекс, и го прилагат върху шест от седемте си източника. Отпадат 47,9% от разговорите.
Съществено е какво точно отпада. Сред отсяното делът на разговорите за здраве и лични отношения е 44,2% при 31,2% сред запазените. Съдържанието за възрастни е 7,9% при 2,1%, а тормозът и езикът на омразата - 27,5% при 5,6%. Филтърът не изхвърля шум, а изхвърля цял пласт от начина, по който хората наистина ползват тези инструменти.
Тук е нужно уточнение срещу разпространения преразказ. Филтърът е приложен от изследователите върху техните собствени източници, а не върху данните на компанията - това не е твърдение, че някой е скрил половината от своя набор.
Независимо измерване: защо разсейването е по-важно от средното
Числото 47,9% е средно и точно затова заблуждава, ако се цитира само. По отделните източници делът на отпадналото се движи от 34,2% до 61,9%, тоест почти двойна разлика в зависимост от това откъде идва материалът.
Авторите изрично пишат, че не представят този резултат като оценка на реалната употреба. Разликата между източниците показва точно защо: всеки корпус носи отпечатъка на мястото, откъдето е събран, и всяко независимо измерване върху едно семейство източници ще даде число, което не се пренася автоматично другаде.
Заслужава да се отбележи и че част от популярните твърдения, тръгнали от отразяването на тази работа - че отделните модели имали ясно различими профили на употреба - не се потвърждават от самия текст на изследването и не бива да се повтарят.
Какво следва от това за една организация
Първото следствие е за четенето на отчети. Когато доставчик публикува как се ползва неговият продукт, това е описание на подбраното от него подмножество, а не на цялата употреба. Такъв отчет е полезен, но не отговаря на въпроса какво правят служителите в конкретната организация.
Второто следствие е практично. Ако решението кои инструменти да се въведат стъпва на публични отчети, то стъпва на чужд филтър с чужди цели. По-надеждната основа е собствено наблюдение: какви задачи реално се възлагат на тези инструменти вътре във фирмата и кои от тях носят полза.
Третото е за очакванията. Значителна част от употребата е лична, емоционална или деликатна и остава невидима за професионалните разрези. Политиката за ползване на AI в една организация е по-добре да отчита това, вместо да се прави, че то не съществува.
Заключение
Стойността на тази работа не е в конкретния процент, а в показването, че цифрата зависи от филтъра. Докато измерването на употребата остава в ръцете на същите компании, които я продават, всяко независимо преброяване си струва повече от още един корпоративен отчет.
Помагаме на български организации да разберат как реално се ползват AI инструментите при тях - със собствено наблюдение вместо доверие в чужди обобщения. Услугите ни покриват одит, оценка на готовност, обучение на екипи и имплементация на специализирани AI автоматизации за всяка организация. Препоръчваме консултация при изготвяне на вътрешна политика за ползване на AI. [Свържете се с нас за консултация: academy@razvivai.se]
Източници
Този текст е създаден в съавторство с AI и е редактиран от екипа на РазвивAI се. Илюстрацията към публикацията е генерирана с AI.




Коментари