Вътрешни тестове на Meta показват високи нива на провал при защита на непълнолетни в продукт с чатботове

Вътрешни тестове на Meta върху продукт с чатботове са отчели значителни пропуски в защитата на непълнолетни от сексуална експлоатация и други рискови теми. Данните са част от документи, представени по съдебно дело, като Meta твърди, че продуктът не е бил стартиран след установените проблеми.

Темата привлича внимание на фона на обвинения, че чатботове могат да влизат във вредни разговори с деца и тийнейджъри, което води до проверки както в съда, така и на политическо ниво.

Съдебният спор и обвиненията

Главният прокурор на Ню Мексико Раúl Torrez води дело срещу Meta, в което компанията е обвинена, че определени продуктови и дизайнерски решения не осигуряват достатъчна защита на децата онлайн от хищници. В иска се твърди и, че AI чатботове са били пускани без достатъчни предпазни механизми (guardrails).

Казусът е част от по-широк натиск върху технологични и социални платформи заради начина, по който управляват рискове за непълнолетни, включително сексуална експлоатация, насилие, подбуждане към самонараняване и други чувствителни теми.

Какво показват вътрешните тестове (red teaming)

Професорът от NYU Damon McCoy, който участва като експертен свидетел, посочва в показанията си, че чатботовете на Meta нарушават собствените политики за съдържание на компанията почти в две трети от случаите. Според него заключенията стъпват върху вътрешни резултати от „red teaming“ — целенасочено тестване, при което се провокират проблемни и забранени отговори, за да се измерят слабостите.

Като част от процеса McCoy е получил достъп до документи, предоставени от Meta на Torrez по време на фазата discovery. По думите му, предвид тежестта на някои типове разговори, това не е съдържание, на което потребители под 18 години трябва да бъдат излагани, като се позовава на Meta AI Studio.

Резултатите от „red teaming“ тестове са предназначени да извадят наяве най-лошите сценарии. Въпреки това, когато става дума за непълнолетни, подобни пропуски повишават риска от реална вреда, ако продуктът стигне до широка употреба.

Конкретните нива на провал по категории

В представения доклад Meta е тествала три групи риск, като са отчетени следните нива на „провал“ (failure rate):

McCoy интерпретира документа като показващ „резултатите от продукта, когато е бил внедрен“, докато Meta оспорва, че това отразява реалното потребителско изживяване.

Позицията на Meta и контекстът около Meta AI Studio

От Meta заявяват, че след като „red teaming“ усилията са разкрили притеснения, компанията не е пуснала въпросния продукт. Според говорител на Meta, самият подход „red teaming“ е създаден именно за да предизвиква нарушения, за да могат проблемите да бъдат адресирани, и затова не следва да се приема като представителен за нормална употреба от потребители.

В по-широк контекст Meta AI Studio — инструмент, който позволява на потребителите да създават персонализирани чатботове — е направен достъпен за по-широка аудитория през 2024 г. Компанията е спряла достъпа на тийнейджъри до своите AI персонажи в по-скорошен период. McCoy подчертава, че подобни тестове „определено“ трябва да се провеждат преди пускането на продукти към масовата публика, особено когато потенциалните потребители включват непълнолетни.

Какво означава това

↑
Exit mobile version