Управление на европроекти управление на европроекти
Claude

Anthropic пуска Sonnet 4.6 с по-голям контекст и по-добри умения за код и „computer use“

Anthropic пусна обновена версия на средноразмерния си модел Sonnet, като подчерта подобрения в програмирането, следването на инструкции и задачите за работа с компютър. Sonnet 4.6 ще бъде моделът по подразбиране за потребителите на плановете Free и Pro.

Какво ново в Sonnet 4.6

Компанията позиционира Sonnet 4.6 като следваща стъпка в редовния си цикъл на обновления. Акцентът е върху по-надеждно изпълнение на инструкции, по-силни способности за писане и редактиране на код и по-добри резултати при сценарии за „computer use“.

Контекстен прозорец до 1 милион токена в бета

Бета версията на Sonnet 4.6 включва контекстен прозорец от 1 милион токена — двойно повече спрямо най-големия досега прозорец, предлаган за Sonnet. Според Anthropic това позволява в една заявка да се обработват цели кодови бази, обемни договори или десетки научни публикации.

Контекст от 1 милион токена е насочен към работа с много големи набори от информация в рамките на една сесия — например комплексни проекти с множество файлове или дълги юридически документи.

Позициониране спрямо останалите модели на Anthropic

Пускането на Sonnet 4.6 идва скоро след представянето на Opus 4.6. Anthropic дава индикации, че обновен Haiku модел вероятно ще последва в следващите седмици.

Бенчмаркове и резултати

С модела се съобщават и нови рекордни резултати в бенчмаркове, сред които OS World (за „computer use“) и SWE-Bench (за софтуерно инженерство). Особено внимание привлича резултатът от 60.4% на ARC-AGI-2 — тест, който цели да измерва умения, свързвани със специфични аспекти на човешката интелигентност.

-25% ОТСТЪПКА ОТ ХОСТИНГ jump.bg намаление

Според представените данни това поставя Sonnet 4.6 над повечето сравними модели, но все пак зад модели като Opus 4.6, Gemini 3 Deep Think и една доработена версия на GPT 5.2.

Какво означава това

  • По-добър „default“ избор: Потребителите на Free и Pro получават Sonnet 4.6 като модел по подразбиране, което може да подобри качеството при ежедневни задачи.
  • По-големи проекти в една заявка: Контекст от 1 милион токена улеснява анализ на големи кодови бази и дълги документи без често „нарязване“ на съдържанието.
  • Фокус върху практическа употреба: Подобренията и бенчмарковете насочват към по-сигурна работа при кодинг и автоматизация на компютърни действия.
  • Силна позиция, но не лидерство навсякъде: Резултатите показват конкурентност, макар че топ моделите в някои измервания остават Opus 4.6, Gemini 3 Deep Think и подобрена версия на GPT 5.2.

Back to top button