Управление на европроекти управление на европроекти
Gemini

Google представи Gemini – ново поколение мултимоделни AI модели за продукти, разработчици и устройства

Google и Alphabet описват AI като най-значимия технологичен преход в съвременната ера и очертават стратегия за внедряване на генеративен изкуствен интелект в масови продукти и платформи. В този контекст Google DeepMind представя Gemini – ново семейство модели, проектирано от самото начало като „мултимодално“.

Gemini 1.0 е оптимизиран в три размера – Ultra, Pro и Nano – и започва да се предлага в различни услуги, включително Bard, Pixel и среда за разработчици през Google AI Studio и Google Cloud Vertex AI.

Gemini: мултимодален модел, създаден от нулата

Demis Hassabis, CEO и съосновател на Google DeepMind, представя Gemini като опит AI да стане по-интуитивен „помощник“ – система, която разбира и комбинира различни типове информация. Моделът е разработен чрез съвместна работа на екипи в Google, включително Google Research.

Ключова характеристика на Gemini е, че е проектиран като нативно мултимодален – работи с текст, код, аудио, изображения и видео, като може да обобщава и разсъждава върху комбинирани входове. Освен това архитектурата е насочена към гъвкаво изпълнение – от центрове за данни до мобилни устройства.

Варианти Gemini 1.0: Ultra, Pro и Nano

Първата версия Gemini 1.0 е разделена на три конфигурации, оптимизирани за различни сценарии:

-25% ОТСТЪПКА ОТ ХОСТИНГ jump.bg намаление
  • Gemini Ultra – най-големият и най-способен модел за силно комплексни задачи.
  • Gemini Pro – вариант за широк спектър от приложения и мащабиране.
  • Gemini Nano – най-ефективният модел за изпълнение директно на устройство (on-device).
Gemini е създаден като нативно мултимодален модел, а не като „сглобка“ от отделни компоненти за текст, изображение и звук – подход, който според Google подобрява разсъждението при сложни задачи.

Резултати от тестове, разсъждение и програмиране

Google посочва, че Gemini Ultra надминава предишни водещи резултати в 30 от 32 широко използвани академични бенчмарка за големи езикови модели. Компанията акцентира и върху MMLU (massive multitask language understanding), където Gemini Ultra постига 90.0% и според представените данни изпреварва човешки експерти при този тест, който включва 57 предметни области (математика, физика, история, право, медицина, етика и други).

Отделно се подчертава резултат от 59.4% на MMMU – бенчмарк за мултимодални задачи, изискващи целенасочено разсъждение. При тестове с изображения Gemini Ultra се представя силно и без подпомагане от OCR системи, което се използва като аргумент за „вродената“ му мултимодалност.

При програмирането Gemini 1.0 е позициониран като модел, който може да разбира, обяснява и генерира код на популярни езици като Python, Java, C++ и Go. Посочени са силни резултати при тестове като HumanEval, както и при Natural2Code – вътрешен набор от данни, базиран на източници, създадени от автори.

Google DeepMind описва и AlphaCode 2 – система за генериране на код, изградена със специализирана версия на Gemini. Според оценката на компанията AlphaCode 2 решава близо два пъти повече задачи спрямо оригиналния AlphaCode и се представя по-добре от 85% от участниците в състезанията (при оригиналния AlphaCode – близо 50%).

Инфраструктура, TPU и мерки за безопасност

Gemini 1.0 е обучаван в мащаб върху AI-оптимизирана инфраструктура с Tensor Processing Units (TPUs) v4 и v5e. Google твърди, че моделът е по-бърз в изпълнение върху TPUs спрямо по-ранни, по-малки и по-слабо способни модели. Компанията представя и Cloud TPU v5p като най-мощната, ефективна и мащабируема TPU система до момента, насочена към обучение на авангардни AI модели и ускоряване на разработката.

По темата за сигурността и отговорното внедряване Google заявява, че при Gemini са приложени най-обхватните оценки за безопасност сред моделите на компанията досега, включително проверки за пристрастия и токсичност. Описани са изследвания и тестове за рискови области като киберофанзива, убеждаване и автономност, както и „adversarial“ подходи за откриване на критични слабости.

За допълнителна проверка Google работи с външни експерти и партньори за „stress test“ на моделите. Споменат е и наборът Real Toxicity Prompts, разработен от Allen Institute for AI, както и използването на специализирани класификатори и филтри за ограничаване на вредно съдържание. Компанията посочва като текущи предизвикателства фактичност, „grounding“, атрибуция и потвърждение на информация.

Като част от по-широка екосистема за стандарти и практики се споменават MLCommons, Frontier Model Forum и AI Safety Fund, както и Secure AI Framework (SAIF).

Къде ще се използва Gemini: Bard, Pixel, Search и инструменти за разработчици

Gemini 1.0 започва внедряване в продукти и платформи на Google:

  • Bard – използва фино настроена версия на Gemini Pro за по-добро разсъждение, планиране и разбиране. Наличен е на английски в над 170 държави и територии, като е планирано разширяване към допълнителни модалности и езици.
  • Pixel – Pixel 8 Pro е първият смартфон, проектиран да изпълнява Gemini Nano. Моделът стои зад функции като Summarize в приложението Recorder и започва внедряване на Smart Reply в Gboard, първоначално за WhatsApp, Line и KakaoTalk, с допълнителни приложения за съобщения по-късно.
  • Search – Google експериментира с Gemini в Search Generative Experience (SGE), като отчита 40% намаление на латентността на английски в САЩ и подобрения в качеството.
  • Други продукти – планира се Gemini да се появи и в Search, Ads, Chrome и Duet AI.

За разработчици и бизнес клиенти Gemini Pro става достъпен през Gemini API в Google AI Studio или Google Cloud Vertex AI. Google AI Studio е уеб инструмент за прототипиране с API ключ, а Vertex AI е позициониран като управлявана платформа с възможности за персонализация и контрол на данните, заедно с корпоративни функции за сигурност, безопасност, поверителност и съответствие.

За Android разработчици се предвижда достъп до Gemini Nano чрез AICore – нова системна възможност в Android 14, която започва от устройства Pixel 8 Pro.

За Gemini Ultra Google съобщава, че продължават разширени проверки за доверие и безопасност, включително „red-teaming“ от външни доверени страни, както и допълнително усъвършенстване чрез fine-tuning и reinforcement learning from human feedback (RLHF). Моделът ще бъде предоставен първо на ограничен кръг клиенти, разработчици, партньори и експерти по безопасност за ранни тестове и обратна връзка, преди по-широко пускане. Планира се и Bard Advanced като ново AI изживяване, което да даде достъп до най-силните модели, започвайки с Gemini Ultra.

Какво означава това

  • За потребителите: по-силни възможности за разсъждение и работа с различни типове съдържание в услуги като Bard и Search, както и повече on-device функции на Pixel чрез Gemini Nano.
  • За разработчиците: нов път за интеграция чрез Gemini API в Google AI Studio и Google Cloud Vertex AI, плюс възможности за приложения, които комбинират текст, код и мултимедия.
  • За бизнеса: фокус върху мащабируемост, контрол на данните и корпоративни политики за сигурност/съответствие във Vertex AI.
  • За пазара на AI модели: Gemini поставя акцент върху нативната мултимодалност и специализирани сценарии (код, on-device), както и върху ускоряване чрез TPU инфраструктура.
  • За безопасността: по-широки тестове за пристрастия и токсичност, външно „stress testing“ и допълнителни механизми за филтриране и класификация на съдържание.

Back to top button