Infrastruktura inteligence: NVIDIA a OpenAI ukazují, proč se frontier AI staví jako celý digitální průmysl

Futuristické propojené datové centrum pro trénink frontier AI s chlazením, rozvodem energie a proudy dat mezi moduly

Umělá inteligence už dávno není jen otázkou jednoho výkonného čipu nebo jedné serverové skříně. Největší modely současnosti vyžadují propojené systémy, které zahrnují výpočetní akcelerátory, procesory, paměť, síť, úložiště, chlazení, rozvod elektřiny i software pro nepřetržitou orchestraci provozu. Právě tento posun je podle mě hlavním sdělením debaty mezi Ianem Buckem z NVIDIA a Sachinem Kattim z OpenAI.

Společnosti mluví o desetileté spolupráci, která začala u prvních GPU superpočítačů a dnes se týká infrastruktury pro trénování i nasazování frontier modelů. V centru pozornosti stojí nejen výkon, ale také energetická efektivita, spolehlivost, bezpečnost, správa heterogenních systémů a schopnost AI optimalizovat samotnou AI infrastrukturu.

Je to důležitá zpráva pro celý technologický sektor. Budoucnost generativní AI se nebude rozhodovat pouze v laboratořích, kde vznikají nové modely. Bude se rozhodovat také v datových centrech, u transformátorů, v síťových přepínačích, ve vývojových nástrojích a v tom, jak dobře se podaří sladit obrovské množství vzájemně závislých komponent.

Obsah

🏭 Od jednotlivého GPU k továrně na tokeny

Ian Buck popsal výraznou změnu v tom, jak se dnes přemýšlí o AI výpočtech. Ještě nedávno bylo možné vnímat akcelerátor GPU jako samostatnou jednotku výkonu. Poté se základní jednotkou stal server, následoval rack a celé řady racků. Nyní se největší AI systémy projektují jako infrastruktura celého datového centra.

Pro většinu současných AI modelů už nestačí jeden GPU ani jeden server. Modely je nutné rozdělit mezi mnoho zařízení a efektivně koordinovat jejich spolupráci. To platí jak pro trénování modelů, tak pro inference, tedy okamžik, kdy model odpovídá na dotazy a provádí úlohy pro uživatele či aplikace.

Výstižně se pro tento přístup používá představa továrny na tokeny. Token je základní jednotka textu, se kterou jazykový model pracuje. U velkých AI služeb je proto cílem vyrábět tokeny rychle, spolehlivě, s nízkou odezvou a za rozumnou cenu. Jenže takovou továrnu nelze optimalizovat pohledem na jednu komponentu.

Je nutné řídit celý řetězec:

  • výkon GPU a CPU,
  • propustnost a latenci sítí,
  • paměťové nároky modelů, včetně správy KV cache,
  • rychlost úložišť a přesunů dat,
  • rozvrhování jednotlivých úloh,
  • spotřebu elektrické energie,
  • chlazení a fyzické uspořádání datového centra,
  • dostupnost systémů při špičkovém zatížení.

Za podstatné považuji, že tento pohled mění i obchodní a provozní logiku AI. Nestačí si pořídit velké množství čipů. Organizace musí vybudovat dodavatelský řetězec, provozní postupy a technické know-how, které jim umožní infrastrukturu vytížit co nejlépe. Cílem není pouze maximalizovat počet instalovaných GPU, ale získat co nejvyšší užitečný výkon při odpovídajících nákladech a energetických limitech.

AI infrastruktura se navíc mění tak rychle, že nejde o jednorázový projekt. Jedná se o soustavný proces návrhu, měření, modernizace a spolupráce napříč celým ekosystémem. Nové modely přinášejí jiné požadavky než předchozí generace, nové akcelerátory mění možnosti optimalizace a provoz ve velkém měřítku odhaluje problémy, které při laboratorním nasazení nejsou patrné.

📈 Scaling laws stále určují tempo investic

Sachin Katti zdůraznil, že takzvané scaling laws, tedy vztah mezi množstvím výpočetního výkonu, dat, velikostí modelů a jejich schopnostmi, podle zkušeností OpenAI stále platí. Praktický důsledek je jednoduchý: pokud investice do výpočtů nadále přinášejí viditelné skoky ve schopnostech modelů, tlak na rozšiřování infrastruktury pravděpodobně nepoleví.

Neznamená to, že více výpočtů samo o sobě automaticky vyřeší každý problém. Znamená to však, že výkon zůstává významnou proměnnou při vytváření stále schopnějších systémů. Každá další generace modelů může potřebovat více výpočetních prostředků pro trénování, ale také pro samotný provoz, post-training, hodnocení, bezpečnostní testování a ladění chování.

Právě tady se ukazuje rozdíl mezi běžným datovým centrem a AI továrnou. U tradičních IT systémů lze infrastrukturu často rozšiřovat po menších blocích. U frontier AI musí být od počátku sladěn výkon, síť, paměť, chlazení a elektrické rozvody. Když jedna část systému nestíhá, omezuje efektivitu všech ostatních.

Pokud například výpočetní akcelerátory čekají na data, síť nebo paměť, drahý hardware nepracuje naplno. Pokud datové centrum nemůže bezpečně dodat potřebný výkon ve špičce, nelze plně využít instalovanou kapacitu. Pokud plánovač úloh nerozumí energetickým nárokům jednotlivých pracovních zátěží, může dojít k plýtvání rezervovanou energií.

Tento trend dobře vysvětluje, proč se AI infrastruktura stále častěji posuzuje jako optimalizace celého systému. GPU zůstávají klíčové, ale samy o sobě nestačí. Stejně důležité jsou síťové technologie, energetické systémy, software pro plánování a telemetrie, která poskytuje detailní obraz o tom, co se v provozu skutečně děje.

Užitečný širší kontext nabízí také Mezinárodní agentura pro energii, která dlouhodobě sleduje růst spotřeby elektřiny datových center a digitálních technologií. S rostoucím významem AI se energetická stránka výpočtů stává strategickou otázkou, nikoli jen provozním detailem.

⚡ Gigawattové datové centrum v Ohiu jako návrh od nuly

Výrazným příkladem nového přístupu je rozsáhlý projekt datového centra v Ohiu, na němž spolupracují OpenAI, NVIDIA a SB Energy. V plně vybudované podobě má dosáhnout výkonu osm gigawattů. To je mimořádně vysoké číslo, které z projektu činí nejen technologickou stavbu, ale také významný prvek regionální energetické soustavy.

Novost projektu nespočívá pouze ve velikosti. Jeho zásadní výhoda vychází z toho, že je navrhován jako greenfield projekt, tedy na čistém místě bez nutnosti přizpůsobovat se staršímu uspořádání. Týmy tak mohou uvažovat o celém systému od základů.

Namísto odděleného návrhu budovy, elektrických rozvodů, racků a softwaru lze propojit všechny vrstvy infrastruktury. To dovoluje vytvořit datové centrum, které bere v úvahu skutečné vlastnosti konkrétních AI pracovních zátěží.

Ne každá úloha totiž zatěžuje infrastrukturu stejným způsobem. Některé úlohy jsou citlivé hlavně na komunikaci mezi uzly a nízkou latenci. Typickým příkladem může být inference, kde záleží na rychlosti generování odpovědí. Jiné procesy, například rozsáhlé dávkové výpočty nebo prefill fáze při práci s velkými vstupy, mohou být výrazně náročnější na počet operací a spotřebu energie.

Tato různorodost otevírá prostor pro chytřejší rozvrhování. Plánovač může rozdělovat práci mezi různé uzly a řady racků tak, aby se výkonové i energetické zatížení vyvažovalo napříč celým datovým centrem. Místo statického přidělení kapacity může systém reagovat na aktuální stav zátěže.

Proč nestačí rezervovat energii pro nejhorší scénář

V tradičním návrhu infrastruktury se může kapacita dimenzovat na teoretické maximum. Problém je, že reálné využití bývá výrazně nižší. Ian Buck upozornil, že takový přístup může znamenat, že organizace většinu času používá například jen 60 až 70 procent rezervované energie.

Chytřejší model pracuje s dynamickým řízením výkonu. Pokud plánovač ví, které úlohy právě běží, kde jsou umístěné a jakou spotřebu vyžadují, může průběžně řídit přísun energie. To vyžaduje inteligentní GPU, racky zvládající krátkodobé energetické špičky, promyšlené napájecí jednotky a kontroléry schopné reagovat na rychlé změny odběru.

V takovém prostředí mají význam i komponenty, které se běžně nedostávají do titulků technologických novinek. Patří sem například kondenzátory pomáhající vyrovnávat krátkodobé výkyvy, transformátory, distribuční prvky a zařízení pro kontrolu elektrických charakteristik. V AI datovém centru mohou rozhodovat o tom, zda systém bezpečně udrží maximální výkon, nebo zda bude nucen výkon omezovat.

Podle popsaného odhadu může návrh od začátku zaměřený na koordinaci výpočtů a energie umožnit umístit do datového centra až o 30 až 40 procent více GPU. Důležité je, že takový efekt není možné jednoduše přidat dodatečně. Musí být součástí architektury od prvního návrhu.

🔌 Datové centrum jako stabilizační prvek elektrické sítě

Debata o obřích AI datových centrech často začíná obavou, zda nepřetíží elektrickou síť. Katti však představil opačnou možnost: správně navržená AI infrastruktura by mohla síti pomáhat stabilizovat zatížení.

Základní myšlenka je adaptivní práce se spotřebou. Pokud se v síti objeví špička, některé výpočetní úlohy by mohly snížit výkon nebo se dočasně přesunout. Když naopak síť disponuje volnou kapacitou, datové centrum může zvýšit aktivitu. Takový model dává největší smysl u úloh, které nejsou citlivé na okamžitou odezvu, například u vybraných trénovacích či dávkových procesů.

Nemůže to fungovat nahodile. Vyžaduje to propojení mezi provozem datového centra a energetickou soustavou, přesnou telemetrii, inteligentní plánování a také jasná pravidla pro spolehlivost služeb. V případě úloh s vysokými požadavky na nízkou latenci není možné výkon jednoduše vypnout bez dopadu.

Přesto jde o důležitý směr. Pokud se datová centra naučí pružně reagovat na dostupnost energie, mohou se stát aktivními účastníky modernizace sítě. To by v ideálním případě mohlo pomoci vyrovnávat odběrové špičky a omezovat potřebu nákladného předimenzování infrastruktury.

Z rozhovoru si odnáším zejména to, že energetická zodpovědnost AI nebude záviset jen na tom, kolik energie datová centra spotřebují. Neméně důležité bude, kdy, kde a jak pružně ji dokážou odebírat. Gigawattový projekt v Ohiu je proto testem technické spolupráce mezi AI, cloudovou infrastrukturou a energetikou.

🧠 Astra na architektuře Rubin: AI optimalizuje vlastní inference

Jedna z nejzajímavějších částí debaty se týkala testování modelu Astra na architektuře Vera Rubin. Sachin Katti popsal experiment, který dobře ukazuje, jak rychle se může optimalizace AI systémů měnit.

Tým nejprve vzal implementaci inference pro Astru optimalizovanou pro architekturu Blackwell a s jen malými úpravami ji spustil na Rubin. Už tento první krok přinesl přibližně trojnásobné zvýšení propustnosti. Z praktického hlediska to znamená, že stejný software dokázal na nové generaci hardwaru zpracovat výrazně více práce.

Následoval ještě ambicióznější krok. Tým použil Astru jako základ pro agenty, kteří měli hledat způsoby, jak optimalizovat inference samotné Astry na čipech Rubin. Vznikla tím rekurzivní smyčka: model pomáhal zlepšovat prostředí, ve kterém sám běžel.

Během 72 hodin agentní systém podle popsaných výsledků našel další zhruba dvojnásobné zvýšení propustnosti. Optimalizace, které by dříve mohly vyžadovat týdny nebo měsíce práce, tak vznikly během jednoho víkendu.

Je však důležité správně pochopit, co tento výsledek znamená. Nejde jen o další výpočetní výkon. Katti zdůraznil roli programovatelného hardwaru, kompilátorů, nástrojů a softwarových stavebních bloků, které umožňují agentům rychle zkoumat velké množství variant. Bez dobře připraveného ekosystému by ani schopný model neměl dostatečný prostor k efektivnímu experimentování.

Pro průmysl to přináší zajímavý posun. AI nebude jen pracovní zátěží, kterou infrastruktura obsluhuje. Stále více se může stát aktivním nástrojem pro návrh, ladění a provoz infrastruktury. Modely mohou pomáhat hledat úzká hrdla, navrhovat efektivnější rozvrhování, analyzovat telemetrii a optimalizovat specifické části softwarového stacku.

V oblasti GPU výpočtů zůstává zásadním základem platforma CUDA, která poskytuje vývojářům nástroje pro využívání paralelního výkonu akcelerátorů. Právě kvalitní softwarová platforma rozhoduje o tom, jak rychle lze potenciál nového hardwaru převést do reálných aplikací.

🧩 Cesta od serveru s osmi GPU k racku se 72 GPU

Ian Buck připomněl jedno z důležitých rozhodnutí, které ovlivnilo vývoj AI infrastruktury NVIDIA. V době generace Hopper byl běžným výpočetním stavebním blokem jeden server s osmi GPU. S rostoucími ambicemi frontier modelů však bylo zřejmé, že tento model nebude dostačující.

Růst směrem k modelům s biliony parametrů vyžadoval rozdělit výpočetní kapacitu novým způsobem. NVIDIA proto přešla k architektuře, v níž jsou GPU propojeny pomocí NVLink switchů napříč celým rackem. Výsledkem je mnohem větší výpočetní doména se 72 GPU, která dovoluje efektivněji pracovat s extrémně rozsáhlými modely.

Taková změna nebyla jen otázkou přidání dalších čipů. Vyžadovala zásah do návrhu hardwaru, síťového propojení, správy paměti, chlazení i systémového softwaru. Buck ji označil za existenční okamžik, protože šlo o sázku na budoucnost, v níž bude potřeba stále větší souvislá výpočetní infrastruktura.

Spolupráce s OpenAI zde sehrála praktickou roli. Vývoj hardwarové platformy je silnější, pokud výrobce dostává zpětnou vazbu od týmů, které nové systémy skutečně používají v extrémním měřítku. Požadavky na trénování, inference, pre-training, post-training a každodenní provoz často odhalí priority, které nejsou zřejmé při izolovaném návrhu produktu.

Nejde přitom o jednorázové vylepšení. Návrh AI infrastruktury se stále více podobá dlouhé sérii iterací. Výrobce hardwaru poskytuje nové možnosti, provozovatel modelů odhaluje reálné limity, software se optimalizuje a nová generace systémů vzniká s využitím získaných zkušeností.

🛡️ Bezpečnost a alignment mohou zvýšit poptávku po výpočtech

Ve veřejné debatě se někdy předpokládá, že zpomalení vývoje nejpokročilejších modelů z důvodů bezpečnosti automaticky sníží potřebu výpočetní infrastruktury. Sachin Katti nabídl jiný pohled. Bezpečnost a alignment, tedy slaďování chování modelů s lidskými záměry a pravidly, mohou potřebu výpočtů naopak zvýšit.

Vedle samotných frontier modelů je totiž nutné vytvářet a provozovat systémy, které jejich chování hodnotí, testují, omezují rizikové výstupy a pomáhají zajišťovat bezpečné nasazení. Pokud budou modely schopnější, mohou být náročnější také procesy, které mají ověřit jejich spolehlivost a soulad s požadovanými pravidly.

To znamená, že celková výpočetní poptávka nebude pocházet pouze z trénování hlavních modelů a generování odpovědí. Významnou roli mohou mít také bezpečnostní modely, alignment modely, hodnoticí systémy a další vrstvy kontroly.

Tento závěr je trochu protiintuivní, ale dává smysl. Pokud organizace chtějí využívat velmi schopné AI systémy zodpovědně, musí investovat do mechanismů, které jejich provoz průběžně měří, vyhodnocují a řídí. Více bezpečnosti tedy nemusí znamenat méně infrastruktury. Může znamenat lepší a rozsáhlejší infrastrukturu.

Pro zájemce o přístup OpenAI k této oblasti nabízí užitečné podrobnosti stránka OpenAI Safety. Bezpečnost v AI není jednorázová kontrola před spuštěním produktu, ale soubor průběžných technických a organizačních procesů.

🧪 Jak NVIDIA používá AI při návrhu vlastních čipů a softwaru

AI se podle Iana Bucka už využívá i uvnitř NVIDIA při vývoji hardwaru a softwaru. Firma nepracuje jen s jedním typem modelu. Používá vlastní modely NeMo a Nemotron, otevřené modely, GPT i další dostupné nástroje. Inženýři tak mají možnost vybírat systémy podle konkrétního úkolu.

Jeden z praktických případů představují rozsáhlé databáze chyb a technických incidentů. NVIDIA má data sahající až do doby Buckovy stáže ve firmě. Taková historie obsahuje obrovské množství znalostí o minulých problémech, opravách, souvislostech a stavu jednotlivých komponent.

Agent, který dokáže nad takovým archivem vyhledávat a vytvářet srozumitelná shrnutí, může inženýrům výrazně usnadnit práci. Místo dlouhého ručního procházení starých záznamů lze rychleji zjistit, zda se podobný problém objevil v minulosti, jak byl řešen a kdo se jím zabýval.

AI se používá také při optimalizaci výtěžnosti křemíku a při kontrole změn v softwaru. V prostředí, jako je ovladač CUDA, nestačí, aby vývojář jednoduše odeslal změnu k nasazení. Kód musí projít odbornou kontrolou, aby se minimalizovalo riziko chyb.

Agentní nástroje zde fungují jako předběžná kontrolní vrstva. Mohou před odevzdáním změny vyhledat známé problémy, časté chyby nebo potenciálně rizikové vzory. Nejde o náhradu lidského experta, ale o doplnění jeho práce. Vývojář získá rychlou zpětnou vazbu a odborník dostane lépe připravený návrh ke kontrole.

Proč rozhoduje i čekací doba

Velmi praktický detail se týkal času. Když interní automatizovaná kontrola trvala jednu až dvě hodiny, vývojáři ji vnímali jako překážku, i když byla užitečná. Po využití GPT se podařilo snížit tokenovou náročnost a dobu běhu. Přibližně 15 minut se ukázalo jako přijatelná hranice pro předběžný test.

Tato zkušenost připomíná, že úspěch AI nástroje nezávisí jen na přesnosti výsledků. Stejně důležitá je integrace do pracovního postupu. I silný nástroj může selhat v praxi, pokud příliš zpomaluje lidi, kterým má pomáhat. Vývojáři potřebují rychlou zpětnou vazbu, srozumitelné výsledky a možnost rozhodnout, jak s doporučením naloží.

Za cenné považuji zejména to, že AI zde není vykreslena jako automatický náhradník lidské práce. Je popisována jako další nástroj v sadě vedle profilerů, kompilátorů, knihoven, testovacích systémů a odborného review.

🌐 Heterogenní infrastruktura je novou normou

Další zásadní téma představuje heterogenita. Moderní AI systémy nestojí jen na GPU. Potřebují CPU, síťové prvky, úložiště, paměť, energetické řízení a celou řadu specializovaných služeb. Každá vrstva má jiné vlastnosti, jiné limity a jiné provozní požadavky.

Katti otevřeně říká, že heterogenita je fakt života. Technologie se dlouho snažily komplikace různých architektur skrývat, ale s rostoucí složitostí AI infrastruktury už to nestačí. Organizace musí umět různé části systému propojit a řídit jako jeden celek.

To platí pro trénování i pro inference. Model může běžet na GPU, ale jeho úspěšné nasazení závisí na práci CPU, kvalitě sítě, rychlosti úložišť a schopnosti orchestrace reagovat na proměnlivou poptávku. U interaktivních aplikací je navíc nutné držet latenci pod kontrolou, protože očekávání ohledně rychlé odezvy stále rostou.

OpenAI chce podle Kattiho pro tento účel využívat vlastní modely a agenty. Podobně jako Astra dokáže optimalizovat kernely, mohou agenti pracovat i s celkovým problémem infrastruktury. Pokud dostanou správné nástroje, telemetrii a přístup k relevantním řídicím parametrům, mohou hledat efektivnější konfigurace napříč systémem.

Podstatná jsou zde dvě slova: telemetrie a ovládací prvky. Agent nemůže optimalizovat infrastrukturu, kterou nevidí a nemůže ovlivnit. Pro efektivní automatizaci je potřeba znát stav hardwaru, vytížení sítí, spotřebu energie, teploty, běžící úlohy, chyby i dostupnou kapacitu. Současně musí existovat bezpečné možnosti, jak upravit rozvrhování, alokaci zdrojů nebo konfiguraci provozu.

🧰 Doménové jazyky, knihovny a tisíce aplikací

Ian Buck zároveň upozornil, že univerzální AI infrastruktura musí obsloužit velmi rozdílné obory. Každý z nich pracuje s vlastním jazykem, vlastními knihovnami, daty a zavedenými postupy. Algoritmické principy mohou být někdy podobné, ale kontext použití se výrazně liší.

Jiné problémy řeší návrhář polovodičů, jiné tým simulující proudění vzduchu kolem křídla letadla a jiné firma optimalizující logistiku, rozvoz jídla nebo provoz výrobní linky. Agentní systémy proto nemohou být užitečné jen díky obecné schopnosti pracovat s textem. Musí rozumět nástrojům a pojmům konkrétního odvětví.

NVIDIA podle Bucka podporuje a sleduje více než 8 000 významných aplikací akcelerovaných GPU. Tato šíře ukazuje, proč jsou knihovny, vývojářské nástroje a oborově zaměřený software tak důležité. Samotný hardware má hodnotu teprve tehdy, když pomáhá lidem řešit skutečné technické, vědecké a podnikové úlohy.

Proto se také rozvoj AI nemusí omezit na konverzační aplikace. Stejná infrastruktura a stejné principy orchestrace mohou podporovat návrh čipů, vědecké simulace, průmyslovou automatizaci, medicínský výzkum, logistiku i další specializované oblasti. Rozhodující bude schopnost spojit obecné modely s daty, nástroji a znalostmi konkrétní domény.

📌 Co bude určovat další generaci AI infrastruktury

Z celé debaty vyplývá, že další kapitola umělé inteligence bude méně o izolovaných technologiích a více o spolupráci mezi vrstvami systému. Výkonnější GPU budou důležité, ale samy nezajistí efektivní AI továrnu. Stejně podstatné bude propojení hardwaru, softwaru, energetiky a provozních procesů.

Za hlavní principy budoucí AI infrastruktury považuji těchto sedm bodů:

  1. Návrh od konce ke konci: Výpočetní výkon, síť, úložiště, chlazení a energie musí vznikat jako propojený celek.
  2. Dynamické plánování: Úlohy bude potřeba přesouvat a rozdělovat podle výkonových, latencních a energetických požadavků.
  3. Energetická pružnost: Velká datová centra mohou reagovat na stav sítě a lépe sladit spotřebu s dostupností elektřiny.
  4. Softwarová optimalizace: Kvalitní kompilátory, knihovny a nástroje mohou výrazně zvýšit užitek z hardwarového pokroku.
  5. AI pro provoz AI: Agenti mohou zrychlit hledání optimálních konfigurací, ladění inference i správu systémů.
  6. Bezpečnost jako výpočetní úloha: Alignment, hodnocení a bezpečnostní modely budou samy vyžadovat významné zdroje.
  7. Otevřenost vůči heterogenitě: Budoucí systémy budou kombinovat více druhů hardwaru a orchestrace se tomu musí přizpůsobit.

Technologická historie často připisuje velké změny jediné průlomové komponentě. V případě frontier AI by to ale byl příliš úzký pohled. Největší pokrok vznikne tam, kde se podaří sladit hardware, modely, síťové technologie, energetiku, vývojové nástroje a zkušenosti lidí, kteří systémy provozují ve skutečném měřítku.

Spolupráce NVIDIA a OpenAI ukazuje, že infrastruktura inteligence není pasivní kulisa pro AI modely. Je to aktivní technologická disciplína, která spoluurčuje jejich tempo, cenu, bezpečnost i praktickou dostupnost. A čím schopnější budou modely, tím více bude záležet na tom, zda se podaří tuto infrastrukturu stavět inteligentněji než kdy dříve.

Share this post

AI World Vision

AI and Technology News