OpenAI пуска обновено изживяване и модел за генериране на изображения в ChatGPT. Подобренията са насочени към по-надеждно изпълнение на указания, по-добро запазване на важни елементи (като сходство на лице) при редакции и по-висока скорост на генериране.
Моделът започва поетапно внедряване за всички потребители на ChatGPT, както и в API под името GPT‑Image‑1.5.
По-точни изображения и по-добро запазване на детайли
Новият модел е позициониран като най-способния универсален text-to-image модел на OpenAI до момента. Той е оптимизиран да следва инструкции по-надеждно, включително при малки и специфични корекции, като едновременно запазва консистентност в осветление, композиция и сходство между входни изображения, изходи и последващи редакции.
Целта е резултатите да отговарят по-добре на намерението на потребителя — от практични фото-редакции до по-убедителни „пробвания“ на дрехи и прически, както и стилистични филтри и концептуални трансформации, които запазват „същността“ на оригинала.
OpenAI посочва, че генерирането вече може да е до 4× по-бързо и позволява стартиране на нови заявки, докато други изображения още се обработват — за по-лесно итеративно експериментиране.Редактиране, трансформации и по-добро изписване на текст
Според описанието, моделът се справя по-добре с различни типове редакции, така че да прави поисканите промени без да „разрушава“ ключовите характеристики на изображението. Подобренията са насочени и към творчески трансформации — добавяне и промяна на елементи като текст и оформление, за да се реализира по-точно дадена концепция.
Друга заявена стъпка напред е рендерирането на текст: моделът трябва да може да възпроизвежда по-плътен и по-дребен текст по-четливо. OpenAI отбелязва и общи качествени подобрения, включително по-естествен вид на резултатите и по-добро справяне при сцени с много малки лица.
Ново пространство за създаване в ChatGPT и API модел GPT‑Image‑1.5
Освен генериране чрез разговор (описвате какво искате и получавате изображение), в страничната лента на ChatGPT се добавя отделно „Images“ пространство за по-бързо разглеждане и експерименти. То включва готови филтри и „trending“ подсказки (prompts) за старт на идеи, както и еднократно качване на „likeness“ — за повторно използване на външен вид в бъдещи създавания, без да се търси отново в галерията.
В API новият модел е достъпен като GPT‑Image‑1.5 и включва същите подобрения за запазване на изображението и редактиране спрямо GPT Image 1. OpenAI посочва, че входните и изходните изображения са с 20% по-евтини в GPT Image 1.5 в сравнение с GPT Image 1, което цели повече итерации в рамките на същия бюджет.
Наличността се разширява глобално за потребителите на ChatGPT и API, като инструментът работи „през моделите“ и не изисква ръчен избор, за да бъде използван. По-ранната версия на ChatGPT Images остава достъпна като custom GPT.
Какво означава това
- По-малко „борба“ с инструкциите: очакване за по-точно изпълнение на конкретни корекции без нежелани промени в други части на кадъра.
- По-добри последователни редакции: по-стабилно запазване на сходство, осветление и композиция при множество итерации върху едно и също изображение.
- По-бърз цикъл на работа: до 4× по-висока скорост и възможност за паралелно генериране улесняват тестването на варианти.
- По-практичен инструмент за бизнес и създатели: по-четлив текст в изображения и по-естествени резултати могат да намалят нуждата от допълнителна обработка.
- По-добра икономика за разработчици: GPT‑Image‑1.5 в API с 20% по-ниска цена за image inputs/outputs спрямо GPT Image 1.
