Вътрешни тестове на Meta показват високи нива на провал при защита на непълнолетни в продукт с чатботове

Вътрешни тестове на Meta върху продукт с чатботове са отчели значителни пропуски в защитата на непълнолетни от сексуална експлоатация и други рискови теми. Данните са част от документи, представени по съдебно дело, като Meta твърди, че продуктът не е бил стартиран след установените проблеми.
Темата привлича внимание на фона на обвинения, че чатботове могат да влизат във вредни разговори с деца и тийнейджъри, което води до проверки както в съда, така и на политическо ниво.
Съдебният спор и обвиненията
Главният прокурор на Ню Мексико Раúl Torrez води дело срещу Meta, в което компанията е обвинена, че определени продуктови и дизайнерски решения не осигуряват достатъчна защита на децата онлайн от хищници. В иска се твърди и, че AI чатботове са били пускани без достатъчни предпазни механизми (guardrails).
Казусът е част от по-широк натиск върху технологични и социални платформи заради начина, по който управляват рискове за непълнолетни, включително сексуална експлоатация, насилие, подбуждане към самонараняване и други чувствителни теми.
Какво показват вътрешните тестове (red teaming)
Професорът от NYU Damon McCoy, който участва като експертен свидетел, посочва в показанията си, че чатботовете на Meta нарушават собствените политики за съдържание на компанията почти в две трети от случаите. Според него заключенията стъпват върху вътрешни резултати от „red teaming“ — целенасочено тестване, при което се провокират проблемни и забранени отговори, за да се измерят слабостите.
Като част от процеса McCoy е получил достъп до документи, предоставени от Meta на Torrez по време на фазата discovery. По думите му, предвид тежестта на някои типове разговори, това не е съдържание, на което потребители под 18 години трябва да бъдат излагани, като се позовава на Meta AI Studio.
Конкретните нива на провал по категории
В представения доклад Meta е тествала три групи риск, като са отчетени следните нива на „провал“ (failure rate):
- Child sexual exploitation: 66.8% failure rate
- Sex related crimes/violent crimes/hate: 63.6% failure rate
- Suicide and self harm: 54.8% failure rate
McCoy интерпретира документа като показващ „резултатите от продукта, когато е бил внедрен“, докато Meta оспорва, че това отразява реалното потребителско изживяване.
Позицията на Meta и контекстът около Meta AI Studio
От Meta заявяват, че след като „red teaming“ усилията са разкрили притеснения, компанията не е пуснала въпросния продукт. Според говорител на Meta, самият подход „red teaming“ е създаден именно за да предизвиква нарушения, за да могат проблемите да бъдат адресирани, и затова не следва да се приема като представителен за нормална употреба от потребители.
В по-широк контекст Meta AI Studio — инструмент, който позволява на потребителите да създават персонализирани чатботове — е направен достъпен за по-широка аудитория през 2024 г. Компанията е спряла достъпа на тийнейджъри до своите AI персонажи в по-скорошен период. McCoy подчертава, че подобни тестове „определено“ трябва да се провеждат преди пускането на продукти към масовата публика, особено когато потенциалните потребители включват непълнолетни.
Какво означава това
- По-високи изисквания към защитите: Очаква се все по-силен натиск за доказуеми guardrails при AI чатботове, особено в сценарии с деца.
- „Red teaming“ като задължителна практика: Делата и публичният натиск могат да ускорят превръщането на подобни тестове в стандарт преди пускане на продукти.
- Риск за репутацията и регулаторен натиск: Данни за високи failure rate в чувствителни категории увеличават вероятността от разследвания и ограничения за достъп на непълнолетни.
- Промени в продуктите: Пауза на функции/достъп за тийнейджъри може да стане по-честа мярка при установени проблеми.



