NVIDIA представи Rubin – нова платформа за изграждане на мащабни AI системи, при която хардуерът и софтуерът са проектирани заедно. Според компанията подходът намалява времето за обучение и цената на генериран токен при инференция, като цели по-ниска обща цена за внедряване на AI.
Rubin включва шест чипа: NVIDIA Vera CPU, NVIDIA Rubin GPU, NVIDIA NVLink 6 Switch, NVIDIA ConnectX-9 SuperNIC, NVIDIA BlueField-4 DPU и NVIDIA Spectrum-6 Ethernet Switch. Платформата носи името на Vera Florence Cooper Rubin.
Какво включва платформата Rubin
Rubin е позиционирана като „една“ суперкомпютърна система, сглобена от шест нови компонента, оптимизирани да работят като обща архитектура. NVIDIA посочва, че резултатът е до 10x по-ниска цена на токен при инференция и обучение на mixture-of-experts (MoE) модели с до 4x по-малко GPU в сравнение с NVIDIA Blackwell.
Платформата се предлага в две основни конфигурации:
- NVIDIA Vera Rubin NVL72 – rack-scale решение, което комбинира 72 Rubin GPU, 36 Vera CPU, NVLink 6, ConnectX-9 SuperNIC, BlueField-4 DPU.
- NVIDIA HGX Rubin NVL8 – платформа със свързани чрез NVLink осем Rubin GPU за x86-базирани генеративни AI среди.
NVIDIA DGX SuperPOD се посочва като референтна архитектура за внедряване в мащаб, включително с NVIDIA BlueField-4 DPUs, NVIDIA ConnectX-9 SuperNICs, NVIDIA InfiniBand и софтуера NVIDIA Mission Control.
Rubin залага на „екстремен codesign“: CPU, GPU, междусвързаност, мрежа и DPU са планирани като единна система, с цел по-висока ефективност при MoE, агентни модели и дълъг контекст.Ключови технологии: NVLink 6, Vera CPU, Rubin GPU и сигурност
NVIDIA описва няколко технологични направления, насочени към агентни модели, reasoning и големи MoE натоварвания:
- Шесто поколение NVIDIA NVLink – пропускателна способност до 3.6TB/s на GPU и 260TB/s на ниво NVL72 rack. NVLink 6 switch добавя функции за обслужваемост и устойчивост, както и вградени изчисления в мрежата за ускоряване на колективни операции.
- NVIDIA Vera CPU – CPU с 88 персонализирани NVIDIA Olympus ядра, съвместимост с Armv9.2 и NVLink-C2C връзка. Подчертава се енергийна ефективност за AI фабрики.
- NVIDIA Rubin GPU – трето поколение Transformer Engine и хардуерно ускорена адаптивна компресия; заявени 50 petaflops NVFP4 изчисления за AI инференция.
- Трето поколение NVIDIA Confidential Computing – във Vera Rubin NVL72 като rack-scale платформа, която поддържа защита на данните през CPU, GPU и NVLink домейни.
- Второ поколение RAS Engine – мониторинг в реално време, толерантност към грешки и проактивна поддръжка. NVIDIA твърди, че модулният дизайн на rack-а (без кабели в tray) позволява до 18x по-бързо сглобяване и сервизиране спрямо Blackwell.
Мрежа и сторидж за AI фабрики: Spectrum-6, Ethernet Photonics и BlueField-4
Rubin е придружена от новости в Ethernet мрежите и сториджа, които са критични за натоварвания с много данни и непрекъснато обучение/инференция.
NVIDIA Spectrum-6 Ethernet е представен като следващо поколение Ethernet за AI мрежи, с 200G SerDes, co-packaged optics и AI-оптимизирани fabric-и. В рамките на Spectrum-X Ethernet Photonics co-packaged optical switch системи NVIDIA заявява 10x по-висока надеждност, 5x по-дълъг uptime за AI приложения и 5x по-добра енергийна ефективност спрямо традиционни подходи. Spectrum-XGS Ethernet е описан като технология, позволяваща центрове за данни, разделени на стотици километри, да работят като една AI среда.
При сториджа NVIDIA въвежда NVIDIA Inference Context Memory Storage Platform – AI-native инфраструктура за мащабиране на inference контекста. Тя използва NVIDIA BlueField-4 и цели по-ефективно споделяне и повторна употреба на key-value cache данни, което да подобри отзивчивостта и throughput-а, включително при agentic AI.
BlueField-4 добавя и Advanced Secure Trusted Resource Architecture (ASTRA), която се описва като „единна доверена контролна точка“ за сигурно provision-ване, изолация и управление на големи multi-tenant AI среди.
Екосистема, партньори и планове за внедряване
Сред организациите, които се очаква да приемат Rubin, са Amazon Web Services (AWS), Anthropic, Black Forest Labs, Cisco, Cohere, CoreWeave, Cursor, Dell Technologies, Google, Harvey, HPE, Lambda, Lenovo, Meta, Microsoft, Mistral AI, Nebius, Nscale, OpenAI, OpenEvidence, Oracle Cloud Infrastructure (OCI), Perplexity, Runway, Supermicro, Thinking Machines Lab и xAI.
Microsoft планира следващо поколение Fairwater AI superfactories с NVIDIA Vera Rubin NVL72 rack-scale системи, с мащаб до стотици хиляди NVIDIA Vera Rubin Superchips. CoreWeave е сред първите, които ще предлагат NVIDIA Rubin, управляван чрез CoreWeave Mission Control. NVIDIA съобщава и за разширено сътрудничество с Red Hat за цялостен AI stack, оптимизиран за Rubin, включително Red Hat Enterprise Linux, Red Hat OpenShift и Red Hat AI.
NVIDIA посочва, че Rubin е в пълно производство и че Rubin-базирани продукти ще са налични от партньори през втората половина на 2026 г. Сред първите облачни доставчици с Vera Rubin-базирани инстанции се посочват AWS, Google Cloud, Microsoft и OCI, както и NVIDIA Cloud Partners CoreWeave, Lambda, Nebius и Nscale. Очаква се Cisco, Dell, HPE, Lenovo и Supermicro да доставят разнообразие от сървъри на база Rubin.
Какво означава това
- По-ниска цена на инференция – заявени до 10x по-ниски разходи на токен спрямо NVIDIA Blackwell, което може да промени икономиката на внедряване на големи модели.
- По-малко GPU за обучение на MoE – до 4x редукция на необходимите GPU според NVIDIA, което влияе директно върху капекс и енергийните бюджети.
- Фокус върху агентни модели и reasoning – архитектурата е оптимизирана за дълги контексти, многостъпкови задачи и висока пропускателност.
- Сигурност и изолация в multi-tenant среди – Confidential Computing и ASTRA са насочени към защита на данни и модели при споделена инфраструктура.
- Мрежата става ключов диференциатор – Spectrum-6 и Ethernet Photonics целят по-висока надеждност и по-добър performance-per-watt за AI фабрики.
