Referenční sestava: Laboratoř robotiky a umělé inteligence v jednom racku

Články před tímto popisují architekturu, softwarový stack, rozpočet na napájení a návrh sítě. Tento uvádí cenu a seznam dílů – čerpající z reálného hardwaru, který Kentino dodalo a otestovalo, nikoli z teoretického kusovníku sestaveného z marketingového listu.

Cílem nasazení je výzkumná nebo integrační laboratoř s jedním až čtyřmi roboty a lokální inferencí a školicí ranvejí. Střední velikost: ne amatérská laboratoř, která sotva obslouží 7 miliard robotů, ani hyperscale cluster, který vyžaduje tým pro správu zařízení. Seriózní pracovní prostředí, které může tým dvou až šesti lidí postavit, provozovat a vyvíjet bez specializovaného DevOps.

Článek se zabývá dvěma úrovněmi stejného architektonického vzoru. 4GPU úroveň vývoje ... je místem, kde většina laboratoří začíná. 8-GPU produkční úroveň ...kde se dostanou po prvním skutečném zatížení. Volba hardwaru je odlišná; architektura je identická.

Co ukazují data o flotile

Společnost Kentino nasadila flotilu jednotně konfigurovaných výpočetních uzlů se 4 GPU. Každá jednotka má stejnou specifikaci: AMD EPYC 7542 (32 jader / 64 vláken, boost 2.9 GHz), 512 GB DDR4 ECC LRDIMM s rychlostí 2666 MT/s na osmi DIMM modulech, čtyři grafické karty RTX 4090 (24 GB VRAM každá, celkem 96 GB), 2TB NVMe scratch disk a 512GB SATA SSD pro operační systém. Základní deska je ASRockRack ROMED8-2T/BCM. Ubuntu 24.04 LTS, jádro 6.8.0-generic, ovladač NVIDIA 590.48.01, CUDA 13.1/13.2.

Všech deset uzlů produkuje identická benchmarková čísla. To není náhoda – to je smysl referenčního sestavení. Když všechny jednotky opouští stejnou konfiguraci, benchmark je specifikace, nikoli náhodný běh.

Výpočet GPU

FP16 tenzor-core matmul napříč čtyřmi kartami (pracovní zátěž 8192 × 8192):

Benchmark GPU — 4× RTX 4090
GPU Trvalý FP16 (TFLOPS) Maximální teplota (stres) Špičkový výkon (napětí)
0 165.8 67 °C 482 W
1 153.2 64 °C 450 W
2 166.4 72 °C 501 W
3 166.2 62 °C 481 W
Celková cena 651.6 ~ 1,914 W

GPU 1 běží asi o 6 % hůře než GPU 0, 2 a 3 – což je v rámci běžného rozpětí pro spotřebitelské karty v rámci křemíkové loterie. Všechny čtyři prošly 60sekundovým testem GPU-burn a kombinovaným testem GPU+CPU s nulovými výpočetními chybami. Teplotní rezerva je příjemná: prahová hodnota pro teplotu při zahřátí pro RTX 4090 je 83 °C a nejteplejší karta v flotile dosáhla vrcholu 73 °C při současném zatížení GPU a CPU. Na žádném uzlu nebyl pozorován throttling.

Praktická poznámka k limitům výkonu: flotila grafických karet se dodává s limity na kartu nastavenými mírně odlišně (450 W, 480 W, 500 W v závislosti na slotu). Pro trvalé produkční využití normalizace všech čtyř karet na 450 W vyhlazuje celkovou spotřebu a snižuje nerovnováhu napájecího zdroje. Penalizace TFLOPS při 450 W oproti 500 W je nižší než 2 % – což nestojí za asymetrické zatížení lišty.

vLLM závěr — Llama 3.3 70B AWQ

Porovnáno s vLLM 0.19.0, tensor_parallel_size=4, gpu_memory_utilization=0.80, max_model_len=2048:

vLLM závěr — Llama 3.3 70B AWQ, 4× RTX 4090
test Výsledek
Jeden požadavek (512 tokenů) 8.0 tok/s
Dávková propustnost (32 souběžných operací, 256 tokenů na operaci) 179.3 tok/s agregát
Průměrná latence na požadavek v dávkovém stavu 32 1,428 ms
Latence P99 (krátká výzva, 16 tokenů) 2,043 ms
Doba načítání modelu 95 s

Jedna důležitá výhrada: benchmark použil awq kvantizační jádro, nikoli awq_marlin, awq_marlin Cesta na Adě Lovelace (RTX 4090) je 2–3× rychlejší z hlediska latence jednotlivých požadavků. Produkční nasazení by měla používat awq_marlin nebo cestu FP8 pod vLLM 0.20+, která tuto mezeru dále zmenšuje. S awq_marlin, výše uvedený počet jednotlivých požadavků se na těchto kartách pohybuje z ~8 taktů/s na přibližně 16–20 taktů/s – což je více v souladu s tím, co uživatelé zažívají v praxi. Celková výhoda dávkové propustnosti je úměrně menší, protože úzké hrdlo při vysoké souběžnosti se přesouvá do šířky pásma paměti spíše než do výpočetní kapacity.

Tato čísla platí pro Llama 3.3 70B v INT4 (AWQ). Model 7B nebo 8B v Q4 běží na stejném hardwaru 4–6× rychleji na token; model 13B běží zhruba 2.5× rychleji. Číslo 70B je relevantním omezením velikosti pro VLM a velké plánovací modely v kontextu robotiky.

llama.cpp – pro jednoho uživatele, bez souběžnosti

Benchmarkováno s llama-cpp-python 0.3.20 (CUDA/cuBLAS), Llama 3.3 70B Instruct Q4_K_M GGUF, všemi čtyřmi GPU:

lama.cpp — lama 3.3 70B Q4_K_M, 4× RTX 4090
test Výsledek
Generování jednoho požadavku (256 tokenů) 19.9–20.3 tok/s
Okamžité vyhodnocení (1302 tokenů) 1,568 tok/s
Doba načítání modelu 10.8 s

Soubor llama.cpp se načítá rychleji (10.8 s oproti 95 s pro vLLM) a na těchto kartách nabízí vyšší rychlost dekódování pro jednoho uživatele, protože neplatí režii plánovače kontinuálního dávkového zpracování. Výhodou je nulová souběžnost – jeden uživatel najednou. Správné čtení těchto čísel: llama.cpp na uzlu se 4 GPU poskytuje vývojáři responzivní 70B model pro interaktivní použití; vLLM je tou správnou volbou v okamžiku, kdy máte více než jednoho klienta.

See I02 pro kompletní rozhodovací matici serving-stacku. Zkrácená verze: začněte s vLLM v Dockeru, použijte awq_marlin kvantizaci a přepněte na llama.cpp pouze pro vývojářské systémy s jedním uživatelem nebo nasazení Jetsonu.

Šířka pásma paměti GPU

Šířka pásma mezi zařízeními (na kartě) je konzistentní a pohybuje se na 920.2–920.6 GB/s napříč všemi čtyřmi kartami – s odchylkou v rozmezí 0.04 %, což potvrzuje, že GDDR6X zde není důležitou proměnnou. Šířka pásma PCIe Host→Device je 26.2–26.3 GB/s, což potvrzuje, že Gen4 x16 je plně vyjednáván při zátěži (stav nečinného spojení ukazuje Gen1 kvůli úspornému režimu ASPM – normální, nikoli chyba). Přenosy mezi GPU a GPU přes PCIe (bez NVLink) měří 19–22 GB/s, což je očekávaný limit pro peer-to-peer přes sdílený kořenový komplex PCIe bez NVLink (viz N03 pro kontext).

Úložiště NVMe

Benchmark NVMe — Fanxiang S660 2 TB Gen4
test Propustnost IOPS
Sekvenční čtení (1 M bloků) 4,589 MB/s 4,376
Sekvenční zápis (1 M bloků) 4,213 MB/s 4,017
Náhodné čtení 4K, QD32 2,325 MB/s 568,000
Náhodný zápis 4K, QD32 2,273 MB/s 555,000

Sekvenční šířka pásma se blíží stropu Gen4 x4. Náhodné IOPS při hloubce fronty 32 se dobře saturují: 568 tisíc IOPS pro čtení je výrazně nad požadavky na načítání LLM nebo vzory přístupu k datovým datům v měřítku jednoho uzlu. Načtení modelu z NVMe do VRAM trvá 10–30 sekund v závislosti na velikosti modelu; tento disk není úzkým hrdlem.

Referenční sestavení

BOM — vývojová úroveň se 4 GPU

Vývojová úroveň je tím správným výchozím bodem pro laboratoř s jedním nebo dvěma roboty, jedním nebo dvěma aktivními modely a občasným dolaďováním LoRA.

Vývojářský uzel se 4 GPU
  • Vypočítat: 4× RTX 4090, AMD EPYC 7542, 512 GB DDR4 ECC
  • Skladování: 2 TB NVMe (scratch) + 512 GB SATA (OS)
  • Síť: 10 GbE integrované (duální port, ROMED8-2T/BCM)
  • PSU: duální ATX, rozdělené napájení
  • Podvozek: Montáž do racku 4U, proudění vzduchu zepředu dozadu
Přepínač ToR
8–16 portů, 10 GbE, spravované (VLAN + QoS)
PoE pro přístupový bod (volitelné)
Wi-Fi 6E přístupový bod
Vyhrazené SSID pro robotickou flotilu, pásmo 6 GHz
UPS
5 kVA dvojitá konverze online

Vývojová úroveň: výpočetní uzel se 4 GPU + spravovaný přepínač ToR + 6 GHz AP + 5 kVA online UPS.

BOM — vývojová úroveň se 4 GPU (EUR bez DPH)
Řádková položka Spec EUR bez DPH (pásmo)
Grafický procesor (×4) RTX 4090 24 GB 2 800–3 200 EUR za kartu
Procesor (CPU) AMD EPYC 7542 32C 1,200–1,600 EUR
Základní deska ASRockRack ROMED8-2T/BCM 800–1,100 EUR
RAM 8× 64 GB DDR4 ECC LRDIMM 3 500–5 000 € (kompletní sada)
NVMe scratch 2 TB Gen4 NVMe 180–260 EUR
Operační systém SATA 512 GB SSD 60–90 EUR
Šasi + ventilátory 4U rackový, průmyslový 400–600 EUR
Zdroj (×2) 2 kW ATX, duální split napájení 300–450 € (pár)
ToR spínač 10 GbE spravované, 8–16 portů 400–700 EUR
Wi-Fi 6E přístupový bod Podpora 6 GHz, PoE 250–450 EUR
UPS 5 kVA dvojitá konverze 1,200–1,800 EUR
Kabeláž + PDU Cat6A + 3fázový PDU 300–500 EUR
Celkový výpočetní uzel 14,500–17,500 EUR
Celkový rozvaděč (uzel + infrastruktury) 17,000–21,000 EUR

BOM — produkční úroveň s 8 GPU

Produkční úroveň zdvojnásobuje počet GPU. Architektonický vzorec je stejný; CPU, RAM a šasi se odpovídajícím způsobem škálují pro podporu osmi slotů PCIe s plnou šířkou pásma. Platforma AMD EPYC Genoa nebo Turin poskytuje rozpočet linek PCIe pro 8× x16 slotů bez kompromisů v oblasti bifurkace (viz W02).

Kusovník — produkční úroveň s 8 GPU (EUR bez DPH)
Řádková položka Spec EUR bez DPH (pásmo)
Grafický procesor (×8) RTX 4090 24 GB 2 800–3 200 EUR za kartu
Procesor (CPU) AMD EPYC Genoa / Turin (schopný dvou socketů) 2,500–4,000 EUR
Základní deska Platforma Janov/Turín, 8× PCIe Gen4/5 x16 1,800–2,800 EUR
RAM 16× 64 GB DDR5 ECC LRDIMM (1 024 GB) 3 500–5 000 € (kompletní sada)
NVMe scratch 2× 4 TB Gen4 NVMe 600–900 EUR
Operační systém SATA 512GB SSD (×2, RAID-1) 120–180 EUR
Šasi + ventilátory Rackový 4U–6U, 8× GPU, průmyslový 1,200–2,000 EUR
Zdroj (×2) 3 kW ATX, duální split napájení 600–900 € (pár)
ToR spínač 25 GbE spravovaný, 24 portů (připraveno pro cluster) 1,200–2,200 EUR
25GbE síťová karta Mellanox ConnectX-5/6, duální port (doplněk) 300–600 EUR
Wi-Fi 6E přístupový bod 6 GHz, PoE 250–450 EUR
UPS 10 kVA dvojitá konverze 3,000–5,000 EUR
Kabeláž + PDU Cat6A / DAC SFP + 3fázový měřený PDU 600–1,000 EUR
Celkový výpočetní uzel 38,000–50,000 EUR
Celkový rozvaděč (uzel + infrastruktury) 44,000–60,000 EUR

Poznámka: Doplňková karta 25 GbE NIC je použitelná pouze v šasi s 8 GPU. Šasi se 4 GPU nemá dostatek místa pro další kartu NIC – 10 GbE integrované porty na ROMED8-2T/BCM představují praktický limit pro úroveň 4 GPU (viz N01 a pravidla stránky produktu).

Úložiště za výpočetním uzlem

Úložné úrovně – robotická laboratoř
stupeň Účel Pravidlo pro dimenzování Křížový odkaz
Uzel NVMe (za provozu) Váhy aktivních modelů, aktuální dávka datové sady 2–4 TB na uzel -
NAS (teplý) Trénovací datové sady, archiv epizod, registr modelů 40–200 TB použitelných W06
Mimo pracoviště / cloud (studený) Dlouhodobý archiv, obnova po havárii Podle potřeby -

Pro vývojářskou úroveň nabízí 4šachtový NAS se 4× 16TB HDD 48 TB použitelných v RAID-5 – dostatek pro rok dat epizod pro laboratoř se 2 roboty. Připojte jej k přepínači ToR přes 10 GbE; nedávejte ho na stejné rozhraní jako provoz robotů.

Napájení a chlazení pro rackový systém

od I04:

Výkon podle úrovně
Konfigurace Výpočetně udržitelné Kompletní rack (včetně robotů, stolů, infrastruktury)
Vývojářská úroveň se 4 GPU ~2.0-2.4 kW ~5-7 kW
Produkční úroveň s 8 GPU ~4.0-5.0 kW ~10-13 kW

Data ze zátěžového testu vozového parku potvrzují, že uzel se 4 grafickými kartami spotřebovává při plném zatížení GPU přibližně 1 914 W, přičemž všechny čtyři karty dosahují svých limitů výkonu. Připočtěte-li CPU (trvale spotřebovává přibližně 120 W), NVMe a režii ventilátorů, uzel dosahuje trvalé spotřeby přibližně 2.1–2.2 kW.

Elektrická instalace pro vývojářskou úroveň: minimální třífázové napájení 400 V 16 A; třífázové napájení 32 A poskytuje prostor pro růst. Kabely PSU na dvou samostatných fázích. Viz I04 a P02 pro schéma zapojení. Pro produkční úroveň (plný stojan s kapacitou 10 kW) potřebujete třífázové napájení 400 V 32 A s chladicím výkonem alespoň 15 kW.

Dimenzování UPS: velikost pouze pro server, nikoli pro roboty. Pro vývojovou úroveň je minimální rozumnou volbou online UPS s dvojitou konverzí 5 kVA. Pro produkční úroveň 10 kVA. Vždy uvádějte online s dvojitou konverzí. Viz P05.

Softwarový stack na holém železe

Ubuntu 24.04 LTS — opravené jádro, zablokované balíčky
  • Ovladač NVIDIA 590.x (připnutý, otevřený modul jádra)
  • Sada nástrojů CUDA 13.x
  • sada nástrojů pro kontejnery nvidia
kontejner vLLM
vllm/vllm-openai:v0.20.x
  • Primární: Llama 3.3 70B FP8 nebo Qwen 2.5 72B AWQ
  • Volitelné: VLM (Qwen2.5-VL 32B na 4 GPU; 72B na 8 GPU)
Obsluha + monitorování
  • llama.cpp (vývojářská / záložní verze pro jednoho uživatele)
  • nginx (reverzní proxy, TLS, autorizace nosiče)
  • Prometheus + vLLM /metriky
  • Exportér DCGM (nástroje GPU SM, napájení, teplota, ECC)
  • Dashboardy Grafana

Softwarový stack: připnutý Ubuntu + ovladač NVIDIA → sada nástrojů pro kontejnery → vLLM + llama.cpp + nginx + monitoring.

Označení řidiče není vyjednávatelné. Vozový park používá řidiče s číslem 590.48.01; apt-mark hold nvidia-driver-590 je první věc po instalaci operačního systému bez obsluhy. Bezobslužná instalace apt-get upgrade který načítá novější ovladač, narušil produkční inferenci přesně tolikrát, kolikrát byste očekávali. Viz L01 pro celý postup.

Monitorování není volitelné. Data z vozového parku ukazují, že GPU 3 na jednom uzlu měla během benchmarkingu opravitelné chyby PCIe AER (RxErr + BadTLP) – automaticky opravené hardwarem, ale viditelné v čítačích DCGM. Bez monitorování se to o několik týdnů později projeví jako „občasné podivné inferenční chyby“. Zapojte DCGM a nastavte upozornění na opravitelné chyby ECC nad základní hodnotou. Viz L05 pro stack Prometheus + Grafana.

Varianty velikostí

Vývojová úroveň se 4 GPU – co na ní skutečně lze spustit

96 GB celkem VRAM (4× 24 GB) s TP=4:

Vhodné pro model — vývojářská úroveň se 4 GPU (96 GB VRAM)
Model Množství Hodí se? Přibližně tok/s (jeden uživatel)
Lama 3.3 / Qwen 2.5 70B AWQ INT4 Ano (~36 GB) 16–22 (s awq_marlin)
Qwen 2.5 VL 32B AWQ INT4 Ano (~20 GB) 18-26
Qwen 2.5 VL 72B AWQ INT4 Ne (potřebuje ~44 GB, omezeně na 4× 24 GB) -
Lama 3.3 70B FP8 Ano (~75 GB na 4 RAM) 14-18
Model třídy 8B Q4_K_M Ano, prostor pro hlavu pro dva 80-120

72B VLM se na INT4 pohodlně nevejde na 4× 24 GB – matematika je sice blízká, ale kontextová okna nad 4K ji posouvají dál. Buď použijte 32B VLM variantu, nebo přejděte na úroveň 8 GPU nebo uzel 4× RTX Pro 6000 Blackwell (každá s 96 GB VRAM) pro třídu 72B. Viz. W07 pro diskusi o VRAM vs. modelové úrovni.

Vývojářská úroveň se zabývá: jedním 70B inferenčním modelem obsluhujícím 1–3 souběžné robotické klienty, jedním VLM (třída 32B) pro vizuální dotazy a občasným dolaďováním LoRA na menším základním modelu. To pokrývá 80 % případů užití v robotických laboratořích v roce 2026.

Produkční úroveň s 8 GPU – dodatečný prostor

Celkem 192 GB VRAM (8× 24 GB):

Propustnost modelu — produkční úroveň s 8 GPU (192 GB VRAM)
Model Množství Config Přibližný celkový tok/s (32 souběžných)
Lama 3.3 70B FP8 TP=4, PP=2 350-500
Qwen 2.5 72B AWQ INT4 TP=4, 2 repliky 400-600
Qwen 2.5 VL 72B AWQ INT4 TP=4 180-280
Model 8B (dialog) FP16 1 GPU na repliku, 8 replik 1,200-1,800

Vrstva s 8 GPU také otevírá dveře k simultánní obsluze více modelů: 70B LLM na 4 GPU a 32B VLM na zbývajících 4, což umožňuje obsluhovat smíšenou flotilu robotů s různými požadavky na modely současně z jednoho zařízení. Na vrstvě se 4 GPU to vyžaduje krok výměny modelu s prostoji 30–120 sekund na výměnu.

Poznámka k TP=8 pro 70B: TP=8 přes PCIe peer-to-peer (bez NVLink) se škáluje hůře než TP=4 × PP=2 při souběžnosti nad 8, protože náklady na komunikaci při all-reduce rostou se stupněm tenzorové paralelnosti. Data z benchmarku ukazují šířku pásma PCIe mezi GPU na 19–22 GB/s – což stačí pro TP=4, ale TP=8 all-reduce při vysokých velikostech dávek tyto linky saturuje. Doporučená konfigurace pro 70B na 8× 4090 je TP=4 × PP=2, jak je znázorněno na I02.

Rozložení racku

Uspořádání racku — 12U až 15U, vývojové nebo produkční
U Složka
1 1U patch panel (Cat6A, optický rozbočovač)
2 1U ToR přepínač (spravovaný 10/25 GbE)
3 Rozšíření baterie UPS 2U (v případě potřeby)
4-5 2U UPS (5 kVA dev / 10 kVA prod)
6 1U PDU (třífázová s měřením, horizontální)
7 1U prázdný / správa kabelů
8-11 4U K-AI výpočetní uzel (dev) / 6U K-AI výpočetní uzel (produkce)
12-13 Prázdné / budoucí rozšíření
14 1U jump host / virtuální počítač pro správu vozového parku
15 Prázdný

Výpočetní uzel se vždy nachází pod přepínačem a UPS – proudění vzduchu zepředu dozadu vyžaduje, aby studený vzduch vstupoval z přední části racku (studená ulička nebo zdroj střídavého proudu v místnosti), procházel serverem a vystupoval do horké uličky v zadní části. Viz W05 a I04 pro disciplínu proudění vzduchu.

Jump host je počítač s výškou 1U nebo Small Form Factor s vývodem pro DisplayPort, který se používá pro počáteční spuštění, instalaci ovladačů a údržbu, když je primární server nedostupný přes síť. Nepotřebuje grafickou kartu. Použitá pracovní stanice nebo malý počítač s výškou 1U, 16 GB RAM a SSD diskem Gen3 je v pořádku.

Co tato sestava není

Ne desktopový GPU server v rackové skříni. Otevřená věžová konstrukce stolního počítače – grafické karty namontované na rozšiřující kartě, bez skříně, ventilátory směřující ke stropu – zde není popsána. Stolní sestavy jsou vhodné pro vývoj; nejsou určeny pro nepřetržitý provoz 24 hodin denně, 7 dní v týdnu a neposkytují směrované proudění vzduchu zepředu dozadu, které udržuje grafické karty na stabilní provozní teplotě po celé týdny.

Není to cluster NVLink. RTX 4090 (třída pro spotřebitele/pracovní stanice) nemá NVLink. Přenosy mezi GPU a GPU probíhají přes PCIe rychlostí 19–22 GB/s, nikoli 900 GB/s. To je dostatečné pro inferenční obsluhu s TP=4 a představuje to skutečné omezení pro trénování s TP=8. Pokud je vaše pracovní zátěž náročná na distribuovaný trénink na modelu s kapacitou 70 MB+, RTX Pro 6000 Blackwell (s podporou NVLink ve své multi-GPU edici) nebo platforma s NVSwitch mění matematiku – ale také cenu. Viz. N03.

Ne redundantní zdroje. Konfigurace s duálním zdrojem napájení využívá rozdělené napájení: zdroj A napájí grafické karty 0 a 1 (plus základní desku), zdroj B napájí grafické karty 2 a 3. Pokud zdroj A selže, přijdete o dvě grafické karty a základní desku. Nic se automaticky nepřepne na záložní zdroj. Jedná se o poctivý duální zdroj – vyvažuje zatížení kolejnice a snižuje riziko vzniku poruch v jednom bodě oproti jednomu velkému zdroji, ale nejedná se o redundanci N+1. Viz W04.

Není to cloudová alternativa pro všechno. Pokud je primární pracovní zátěží vaší laboratoře desetkrát denně volání jednoho modelu, matematika celkových nákladů na vlastnictví (TCO) neopravňuje použití on-premise řešení. Tato sestava se vyplatí oproti výdajům na cloudové API, když spouštíte trvalou inferenci pro více klientů, pravidelně dolaďujete nebo pracujete s omezeními týkajícími se uložení dat. Viz T02 pro detailní matematiku.

Proč tyto konkrétní volby

AMD EPYC 7542 jako hostitelský procesor. 32jádrový EPYC poskytuje 128 linek PCIe 4.0 pouze z CPU, což stačí pro 4× GPU v rozlišení x16 bez rozdvojení, plus síťovou kartu, úložiště a PCIe přepínač pro rozšíření. EPYC je standardní platformou pro servery s umělou inteligencí s více GPU v tomto měřítku z nějakého důvodu: Intel Xeon se stejným počtem jader poskytuje méně linek PCIe, což nutí ke kompromisům v rozdvojení u konfigurací se 4 a více GPU. Viz W02 pro aritmetiku počtu jízdních pruhů.

512 GB systémové RAM. Flotila je dodávána s 512 GB (8 × 64 GB), což překračuje nominální specifikaci 256 GB. Toto je záměrné: velké načítání modelu během spouštění kontejneru, předběžné načítání datové sady pro trénování a mezipaměť stránek operačního systému spotřebovávají RAM, kterou VRAM nemůže. Pro vLLM s povoleným odkládacím prostorem KV-cache je systémová RAM přímo použitelná jako přeplněná – 4 GB odkládacího prostoru na GPU vyžaduje 16 GB systémové RAM. 512 GB poskytuje tento prostor s místem pro Isaac Sim, který může během trénování politik pojmout 10–30 GB simulačního stavu v systémové RAM.

2TB NVMe disk bez nutnosti zátěže. Benchmark ukazuje sekvenční čtení 4 589 MB/s – což je dostatečně rychlé k načtení 70B modelu FP8 (cca 75 GB) za méně než 20 sekund. Pro laboratoř, která často mění modely (vývojový pracovní postup, A/B testování, inferenční zásobníky), je doba načítání důležitá. Pomalejší SATA SSD tento čas na jednu výměnu zdvojnásobí nebo ztrojnásobí.

Proudění vzduchu do racku zepředu dozadu. Nejčastější chyba při prvních sestavách: orientace stolu (boční sání, horní výfuk, zadní výfuk) nefunguje v uzavřeném racku. Výpočetní uzel musí používat směrované proudění vzduchu odpovídající konvenci racku pro studené a teplé uličky. Viz I01 a W05.

Upřímný pohled na hardware pro rok 2026

Toto je referenční sestavení z května 2026. RTX 4090 není nejnovější variantou grafické karty Kentino – k dispozici jsou RTX 5090 (32 GB VRAM, architektura Blackwell, sm_120) a RTX Pro 6000 Blackwell (96 GB VRAM), které výrazně mění poměr VRAM na kartu. Uzel se 4 GPU a RTX Pro 6000 Blackwell poskytuje 384 GB VRAM – dostatek pro pohodlné hostování Qwen 2.5 VL 72B v 8. FP na čtyřech kartách – za proporcionálně vyšší cenu na kartu.

Co se mezi generacemi nemění: architektonický vzorec. Hostitel AMD EPYC, PCIe multi-GPU, šasi typu front-to-back, duální zdroj, Ubuntu 24.04, vLLM v Dockeru, Prometheus + DCGM exportér. Tento vzorec byl konzistentní napříč dvěma generacemi GPU a přežije i tu další. Seznam dílů se zlevní a zrychlí; vzorec se drží.

Co dělat dál – postup dimenzování

Odpovězte na tyto otázky postupně. Každá otázka se zaměřuje na tu další.

  1. Jaké modely potřebujete hostovat současně? Zapište si názvy a počty parametrů. 70B LLM + 32B VLM současně vyžaduje alespoň 96 GB VRAM. 70B LLM + 72B VLM současně vyžaduje 192 GB VRAM nebo více. Toto je vaše spodní hranice VRAM. Pokud spodní hranice přesahuje 96 GB, daná vývojářská úroveň není vaší verzí.
  2. Kolik souběžných robotických klientů je ve špičce? Jeden robot s občasnými dotazy → vývojová vrstva to zvládá. Čtyři roboti spouštějící nepřetržité smyčky vnímání (volání VLM každé 2 sekundy) → 8 souběžných požadavků, což je na vývojové vrstvě zvládnutelné, ale je třeba měřit s ohledem na délku kontextu. Osm robotů → produkční vrstva nebo dva uzly vývojové vrstvy.
  3. Potřebujete tréninkovou kapacitu? Jemné doladění LoRA na 8B modelu vyžaduje přibližně 20 GB VRAM a vejde se na jednu RTX 4090. Úplné jemné doladění 70B modelu vyžaduje stovky GB VRAM s gradientním kontrolním bodem a 3D paralelismem – to je jiná debata. Většina laboratoří začíná s LoRA na malých modelech, o které se stará vývojářská vrstva.
  4. Jaký máte dnes výkon a chladicí limit? Buďte upřímní. Spusťte tabulku zatížení z I04 proti stávajícímu elektrickému napájení vaší budovy. Pokud jste na jednofázovém obvodu 16 A sdíleném se zbytkem kanceláře, vyžaduje vývojářská úroveň nový obvod před čímkoli jiným. Toto je nejčastější plánovací chyba.
  5. Máte softwarového integrátora? Výše uvedený hardware je pouze polovina systému. Ovladač ROS 2 pro vašeho robota, klient gRPC pro vLLM, úložiště paměti scén, konfigurace monitorování – to je 2–6 týdnů skutečné inženýrské práce na nové laboratoři. Pokud kupujete hardware bez integračního plánu, kupujete si druhou polovinu systému bez té první. Viz I02 a I01 pro integrační obrázek.

Když dokážete odpovědět na všech pět otázek, je velikost sestavení zřejmá. Pokud nemůžete odpovědět na otázku 1 (seznam modelů) ani na otázku 3 (rozsah školení), vraťte se, až budete moci – tyto dvě odpovědi tvoří 90 % nákladů. Tým Kentino může vytvářet cenové nabídky z vyplněné sady odpovědí; nabídky proti vágním požadavkům vyžadují tři kola revize a stále se mýlí.


Toto je součást Kentino Wiki, referenční série o výpočetní technologii s využitím umělé inteligence, robotice a systémech, které je propojují. Komentáře a opravy jsou vítány na adrese info@kentino.com.