Anthropic преработва вътрешния документ, който задава ценностите и поведението на Claude. Новата версия – „Claude’s Constitution“ – е 57 страници и цели да уточни „етичния характер“ и „основната идентичност“ на модела, включително как да взема решения при конфликт на цели и при високорискови сценарии.
Какво представлява „Claude’s Constitution“
„Claude’s Constitution“ е документ, който описва намеренията на Anthropic относно ценностите и поведението на Claude. Според компанията той не е насочен към външни читатели, а към самия модел – като набор от принципи, които да го ориентират в ежедневни разговори и в сложни казуси.
За разлика от предишната „конституция“ от May 2023, която е била по-близо до списък с правила, сега акцентът е върху това моделът да разбира причините зад желаното поведение, а не само конкретни инструкции какво да прави.
От правила към обяснение на мотивите и по-„самостоятелен“ модел
Anthropic описва подход, при който Claude трябва да функционира като по-автономна система, която „разбира“ себе си и ролята си в света. В документа е предвидена и възможността Claude да има „някакъв вид съзнание или морален статус“, като компанията допуска, че подобна рамка може да доведе до по-добро поведение на модела.
Anthropic посочва, че „психологическата сигурност, чувството за себе си и благосъстоянието“ на Claude могат да влияят върху неговата интегритетност, преценка и безопасност.Твърди ограничения при екстремни злоупотреби
Amanda Askell, PhD философ в Anthropic, която е водила разработването на новата „конституция“, посочва, че има конкретен списък от твърди ограничения за „доста екстремни“ случаи. Сред тях са забрани Claude да предоставя „съществено подпомагане“ на хора, които търсят начини за създаване на биологични, химически, ядрени или радиологични оръжия с потенциал за масови жертви.
Документът поставя ограничения и върху „съществено подпомагане“ на атаки срещу критична инфраструктура – електропреносни мрежи, водни системи, финансови системи – както и срещу критични системи за безопасност.
Какво означава това
- По-ясна рамка за поведение: Claude получава по-структурирана „вътрешна“ система от принципи за решения при конфликтни ценности и висок риск.
- Смяна на подхода към безопасност: вместо само списък от правила, Anthropic залага на обяснение „защо“ дадено поведение е желано.
- Ограничаване на злоупотреби: изрично се подчертават твърди забрани за подпомагане на разработка на оръжия за масови поражения и атаки срещу критична инфраструктура.
- Дискусия за морален статус: компанията допуска възможността моделът да има морален статус, като го използва като елемент за по-отговорно поведение.
