Co stojí za inteligencí, která mění váš obor

Když spustíte AI nástroj a během vteřiny dostanete odpověď, analýzu, hotový text nebo po chvilce nikdy neexistující fotku nebo video, pravděpodobně vás nenapadne, co se děje „pod kapotou".

Výsledek vypadá lehce, skoro magicky. Porozumět tomu, z čeho se AI infrastruktura skládá, není otázka technické zvědavosti. Je to praktické vědění, které vám pomůže lépe chápat možnosti, limity i náklady nástrojů, které dnes možná již používáte nebo teprve plánujete nasadit ve svém oboru. Zvlášť když plánujete nasazení a provoz vlastního offline modelu.

GPU grafické karty - mozek a lopata, který AI pohání

Grafická karta, nebo přesněji GPU (Graphics Processing Unit), je srdcem každého AI systému. Původně vznikla pro vykreslování her a videí, ale ukázalo se, že její architektura je ideální i pro něco zcela jiného: zpracování obrovského množství matematických výpočtů najednou. Nedávné "zneužití" jste mohli vidět v těžbě bitcoinů.

Zatímco klasický procesor (CPU) zvládá úkoly postupně a velmi rychle - obsahuje několik silných jader/procesorů, GPU jich obsahuje o řády víc (slabších, říká se jim CUDA, např nvidia RTX 4060 jich má cca 3000 a 96 sepciálních tensor jader pro AI) a dokáže provádět tisíce operací paralelně. Trénování AI modelu si představte jako sestavování milionů dílků puzzle současně – CPU by je skládalo jeden po druhém, GPU je skládá všechny naráz.

Proto v moderních AI datových centrech nenajdete desítky, ale tisíce GPU karet, jejichž hodnota se pohybuje v řádu stovek tisíc korun za kus.

CPU - řidič procesu

Klasický procesor je spíš principálem toho cirkusu - předává data pro výpočet, formátuje a zobrazuje výstup. Zpravidla nebývá tím úzkým hrdlem.

Pamět - RAM a VRAM

Klasická paměť počítače (RAM; co vidíte jako jeden z prvních údajů na krabici počítače) je přes řadič připojená k procesoru a zbytku. Pamět přímo na grafické kartě - VRAM - je vůči těm makajícím CUDa procesorům nakrátko s propustností až 300GB (4060) i víc. Protože AI výpočet je něco jako obrovská matice gigabitový velikosti, potřebují procesory neustálý přísun dat. Je-li VRAM málo a bere data z té počítačové (nebo dokonce disku) tak významně zpomalí. 

Napájení, chlazení, spotřeba

Špičkové grafické kartý mají spotřebu ve stovkách wattů - větší než celý běžný počítač nebo běžný kancelářský server. A to potřebuje, mimo dimenzovaného zdroje napájení, i chlazení.

Pro provoz je tedy potřeba zohlednit nejen pořizovací cenu komponent (především té karty)  ale i provozní spotřebu a věci s tím spojené  - chlazení a hluk.  

U provozu vlastních lokálních AI modelů jde kombinovat použití vlastního slabšího offline modelu a vzdálený (cloudový) model na hrubou sílu (je potřeba počítat s nějakým poplatkem při pravidelném nebo intenzivním používání)