Claude Opus 4.6: по-силен в програмирането, 1M контекст и нови инструменти за разработчици

Anthropic обнови най-силния си модел, като пусна Claude Opus 4.6 с фокус върху програмиране, по-дълги автономни задачи и работа с много голям контекст. Компанията добавя и нови възможности в Claude Code и Claude Developer Platform, както и подобрения в офис инструментите.

Opus 4.6 запазва цената си от $5/$25 на милион токена и е наличен в claude.ai, през API и в големите облачни платформи. За разработчици моделът е достъпен като claude-opus-4-6.

Какво ново в Claude Opus 4.6

Според Anthropic, Opus 4.6 надгражда Claude Opus 4.5 с по-силни способности за кодиране и по-устойчиво изпълнение на агентни задачи. Моделът планира по-внимателно, задържа фокус по-дълго, работи по-надеждно в по-големи кодови бази и подобрява code review и debugging, включително засичане на собствени грешки.

Ключова новост за Opus-клас е контекстен прозорец от 1 милион токена (beta). Това разширява сценариите, в които моделът може да обработва и проследява много информация без съществено „разпадане“ на контекста.

Opus 4.6 е първият Opus-клас модел на Anthropic с 1M token контекст (в beta), а изходът може да достига до 128k токена — полезно при генериране на по-големи артефакти като отчети, спецификации и код.

Резултати от тестове и сравнения

Anthropic позиционира Opus 4.6 като водещ модел в редица оценки. Сред примерите са най-висок резултат на Terminal-Bench 2.0 (agentic coding) и лидерство на Humanity’s Last Exam (мултидисциплинарен тест за комплексно разсъждение).

В GDPval-AA (за икономически ценни задачи в области като финанси и право) Opus 4.6 изпреварва OpenAI GPT-5.2 с около 144 Elo точки и Claude Opus 4.5 с 190 точки. Моделът води и на BrowseComp, където се измерва способността за намиране на трудно откриваема информация онлайн.

При задачи с много голям контекст Anthropic акцентира върху подобрение спрямо т.нар. „context rot“. На MRCR v2 (8-needle, 1M вариант) Opus 4.6 достига 76%, докато Sonnet 4.5 е на 18.5%, което според компанията е качествена промяна в това колко ефективно може да се използва дълъг контекст.

Безопасност и мерки срещу злоупотреба

По данни от системните оценки, повишените способности не водят до влошаване на профила по безопасност. В автоматизиран поведенчески одит Opus 4.6 показва ниски нива на несъгласувано поведение като измама, подмазване, насърчаване на заблуди и съдействие при злоупотреба. Компанията твърди и че моделът има най-ниски нива на „over-refusal“ (откази при безобидни заявки) сред последните версии на Claude.

Anthropic съобщава, че е провела най-широкия си пакет от тестове за безопасност за този модел, включително нови оценки за благосъстоянието на потребителя, по-сложни тестове за отказ при потенциално опасни заявки и обновени проверки за опити моделът да извършва вредни действия незабелязано. Използвани са и методи от interpretability за по-добро разбиране на вътрешните механизми на поведение.

Поради по-силните способности в киберсигурността са добавени шест нови „cybersecurity probes“ за засичане на вредни отговори и проследяване на потенциални сценарии за злоупотреба. Паралелно моделът се използва и за защитни цели, включително откриване и закърпване на уязвимости в open-source софтуер; Anthropic посочва, че може да въведе интервенции в реално време за блокиране на злоупотреби.

Обновления в API и продуктите: агенти, компактиране и офис инструменти

Claude Developer Platform получава функции, насочени към по-дълги задачи и по-прецизен контрол над разход/скорост:

В Claude Code се добавя „agent teams“ (research preview) – стартиране на няколко агента, които работят паралелно и се координират автономно, подходящо за задачи, които се разделят на независими подзадачи, като прегледи на кодови бази. Потребителят може да поеме контрол над подагент чрез Shift+Up/Down или tmux.

Има и подобрения за офис работа: Claude в Excel е надграден за по-дълги и по-сложни сценарии, включително планиране преди действие, приемане на неструктурирани данни и извеждане на подходяща структура без изрични указания, както и изпълнение на многостъпкови промени „на един път“. Claude в PowerPoint излиза като research preview за плановете Max, Team и Enterprise, като поддържа съобразяване с оформления, шрифтове и slide masters за консистентност с бранда.

Какво означава това

Exit mobile version