OpenAI представи GPT-5.3-Codex-Spark — вариант на Codex с по-ниска консумация и фокус върху бързи, прекъсваеми задачи по писане и редакция на код. За компанията това е първото продукционно внедряване на модел върху хардуер извън дългогодишния ѝ основен стек с Nvidia, като стартът е под формата на research preview за потребители на ChatGPT Pro.
Какво представлява GPT-5.3-Codex-Spark
Според OpenAI моделът е настроен за интерактивни работни процеси при разработка — например редактиране на конкретни части от код и пускане на целеви тестове. Целта е да се поддържа висок пропускателен капацитет при обслужване върху хардуер с ултраниска латентност.
OpenAI посочва, че при подходяща конфигурация GPT-5.3-Codex-Spark може да надхвърля 1 000 токена в секунда. Моделът по подразбиране цели минимални промени в кода и няма автоматично да изпълнява тестове, освен ако не му бъде изрично зададено.
Защо Cerebras: Wafer Scale Engine и фокус върху латентността
Моделът се обслужва върху Wafer Scale Engine от трето поколение на Cerebras Systems. За разлика от типичните GPU клъстери, изградени от много отделни чипове, свързани чрез високоскоростни интерконекти, подходът на Cerebras използва един wafer-scale процесор с стотици хиляди AI ядра и големи обеми вградена памет.
Архитектурата е проектирана да намали преместването на данни и да сведе латентността до минимум — фактор, който често ограничава производителността при интерактивно „инференс“ натоварване, когато потребителят очаква незабавна реакция.
Фокусът на това внедряване не е обучението на най-големите модели, а отделен „слой“ изчислителна инфраструктура, оптимизиран за бърз отговор и висока интерактивност при писане на код.Позицията на Nvidia и паралелните партньорства
OpenAI вече обяви, че е подписала договор за използване на хардуер на Cerebras за инференс с ниска латентност и планира поетапно да пусне 750 мегавата изчислителна мощност, подсигурена от Cerebras, до 2028 г. Компанията уточнява, че това не заменя ролята на Nvidia в инфраструктурата за обучение, а добавя капацитет, оптимизиран за отзивчивост.
Sam Altman коментира в X.com, че OpenAI харесва работата с Nvidia и че „те правят най-добрите чипове в света“, като добавя, че OpenAI се надява да остане „огромен клиент“ за дълго време. Това се случи на фона на спорен доклад на Reuters, според който OpenAI не е доволна от някои чипове на Nvidia.
OpenAI описва партньорството си с Nvidia като „фундаментално“ и посочва, че компанията остава „закотвена“ към Nvidia като ядро на своя стек за обучение и инференс, като същевременно разширява екосистемата чрез партньорства с Cerebras и други. Най-мощните модели на OpenAI продължават да се обучават и обслужват върху системи на Nvidia.
Паралелно с това OpenAI е постигнала договорка да внедри 6 гигавата чипове от AMD в рамките на няколко години, както и сделка с Broadcom за разработка на персонализирани AI ускорители и мрежови компоненти.
Codex: ръст на потребителите и следващи стъпки
По данни на OpenAI Codex вече има над 1 милион седмично активни потребители. Достъпът до GPT-5.3-Codex-Spark първоначално е насочен към ChatGPT Pro, а в следващите седмици се очаква разширяване и извън Pro, докато компанията преценява производителността и търсенето.
Какво означава това
- Първа продукционна диверсификация извън Nvidia: OpenAI започва реално обслужване на модел върху силиций от друг производител, без да променя централната роля на Nvidia за обучението.
- Отделен капацитет за ниска латентност: Cerebras се позиционира като инфраструктурен слой за бърз инференс и интерактивни задачи, където времето за отговор е критично.
- По-конкурентна хардуерна стратегия: Паралелните ангажименти към AMD и Broadcom подсказват по-широка многодоставчикова политика за чипове и мрежова част.
- Фокус върху продуктивността при програмиране: Codex-Spark е насочен към редакции „на място“, таргетирани тестове и минимални промени — полезно за ежедневни задачи в IDE/чат сценарии.
