Вътрешни тестове на Meta показват високи нива на провал при защита на непълнолетни в продукт с чатботове

Вътрешни тестове на Meta върху продукт с чатботове са отчели значителни пропуски в защитата на непълнолетни от сексуална експлоатация и други рискови теми. Данните са част от документи, представени по съдебно дело, като Meta твърди, че продуктът не е бил стартиран след установените проблеми.

Темата привлича внимание на фона на обвинения, че чатботове могат да влизат във вредни разговори с деца и тийнейджъри, което води до проверки както в съда, така и на политическо ниво.

Съдебният спор и обвиненията

Главният прокурор на Ню Мексико Раúl Torrez води дело срещу Meta, в което компанията е обвинена, че определени продуктови и дизайнерски решения не осигуряват достатъчна защита на децата онлайн от хищници. В иска се твърди и, че AI чатботове са били пускани без достатъчни предпазни механизми (guardrails).

Казусът е част от по-широк натиск върху технологични и социални платформи заради начина, по който управляват рискове за непълнолетни, включително сексуална експлоатация, насилие, подбуждане към самонараняване и други чувствителни теми.

Какво показват вътрешните тестове (red teaming)

Професорът от NYU Damon McCoy, който участва като експертен свидетел, посочва в показанията си, че чатботовете на Meta нарушават собствените политики за съдържание на компанията почти в две трети от случаите. Според него заключенията стъпват върху вътрешни резултати от „red teaming“ — целенасочено тестване, при което се провокират проблемни и забранени отговори, за да се измерят слабостите.

Като част от процеса McCoy е получил достъп до документи, предоставени от Meta на Torrez по време на фазата discovery. По думите му, предвид тежестта на някои типове разговори, това не е съдържание, на което потребители под 18 години трябва да бъдат излагани, като се позовава на Meta AI Studio.

Резултатите от „red teaming“ тестове са предназначени да извадят наяве най-лошите сценарии. Въпреки това, когато става дума за непълнолетни, подобни пропуски повишават риска от реална вреда, ако продуктът стигне до широка употреба.

Конкретните нива на провал по категории

В представения доклад Meta е тествала три групи риск, като са отчетени следните нива на „провал“ (failure rate):

McCoy интерпретира документа като показващ „резултатите от продукта, когато е бил внедрен“, докато Meta оспорва, че това отразява реалното потребителско изживяване.

Позицията на Meta и контекстът около Meta AI Studio

От Meta заявяват, че след като „red teaming“ усилията са разкрили притеснения, компанията не е пуснала въпросния продукт. Според говорител на Meta, самият подход „red teaming“ е създаден именно за да предизвиква нарушения, за да могат проблемите да бъдат адресирани, и затова не следва да се приема като представителен за нормална употреба от потребители.

В по-широк контекст Meta AI Studio — инструмент, който позволява на потребителите да създават персонализирани чатботове — е направен достъпен за по-широка аудитория през 2024 г. Компанията е спряла достъпа на тийнейджъри до своите AI персонажи в по-скорошен период. McCoy подчертава, че подобни тестове „определено“ трябва да се провеждат преди пускането на продукти към масовата публика, особено когато потенциалните потребители включват непълнолетни.

Какво означава това

Exit mobile version