Ethernet pro umělou inteligenci: Základy 25/100/400 GbE
Ethernet je výchozí infrastrukturou pro jakýkoli cluster umělé inteligence postavený mimo hyperscaler. Na papíře to není vždy nejrychlejší možnost – N02 bude argumentovat pro InfiniBand tam, kde skutečně vítězí – ale je to možnost, která existuje všude, provozuje všechny sousední nástroje, stojí nejméně za gigabit a nevázne vás k ničemu.
Pro clustery na úrovni Kentino – inferenční servery s jedním uzlem, tréninková zařízení s 2 až 8 uzly, malé výzkumné laboratoře – je Ethernet v podstatě vždy správnou odpovědí. Zajímavé otázky jsou: jaká rychlostní úroveň, která síťová karta (měděná nebo optická) a kolik jednotlivé zvýšení výkonu skutečně stojí. Tento článek na ně upřímně odpovídá s čísly z cen z poloviny roku 2026.
Pokud nasazujete jeden 4-GPU nebo 8-GPU box jen pro inferenci a nic jiného, můžete přejít na tabulku nákladů dole a zastavit se. Zbytek tohoto článku je určen pro plánovače více uzlů.
Proč Ethernet vítězí automaticky
Tři důvody, seřazené podle toho, jak často skutečně ovlivňují rozhodnutí:
- Ekosystém. Každý server, přepínač, úložný systém a orchestrátor mluví ethernetovým jazykem. Ovladače jsou součástí jádra. Monitorovací nástroje to předpokládají. První den nového zaměstnance není ve stylu „dovolte mi vysvětlit InfiniBand“.
- Cena za gigabit. 100GbE přepínací port stojí zhruba čtvrtinu ceny srovnatelného HDR InfiniBandu. DAC a transceivery jsou běžnou komoditou. Síťové karty dodává více dodavatelů – NVIDIA, Broadcom, Intel – což udržuje ceny na férové úrovni. InfiniBand je od jednoho dodavatele.
- Bez uchycení látky. Ethernet je transportní síť. Moderní přepínače zvládají provoz TCP, RoCE, NVMe-oF a management plane na stejném kabelu s rozumnou QoS. InfiniBand zavazuje tuto fabricu k plánu NVIDIA.
Výhodou je, že Ethernet pro AI potřebuje více ladění, aby dosáhl stejného chování rychlosti kabelu, jaké vám InfiniBand nabízí ihned po vybalení. RoCEv2, PFC, ECN, DCQCN – vše konfigurovatelné na Ethernetu, vše předkonfigurované na IB. N02 a N08 tento problém zvládnou.
Úrovně rychlosti a kdy každá z nich dává smysl
Největší chybou u cenových nabídek na úrovni Kentino je nadměrná specifikace propojení. 400GbE přepínač pod inferenčním boxem s 8 GPU jsou vyhozené peníze. 10GbE propojení mezi dvěma trénovacími uzly je ztracený čas GPU. Mapa níže je ta, na které záleží.
| stupeň | Sladká skvrna | Náklady na port (polovina roku 2026) | Poznámky |
|---|---|---|---|
| 1/10 GbE | Správa, IPMI/BMC, bootstrap, SSH | 50 € - 200 € | Vždy odděleně od datové roviny |
| 25 GbE | Administrativní uplink, lehké úložiště, příjem datové sady pod ~3 GB/s | 300 € - 600 € | Nejlevnější „skutečná“ úroveň; 2× SFP28 standard na většině serverů |
| 100 GbE | Vnitroklastrová základní linie pro trénování 2–8 uzlů a úložiště RoCE | 1200 € - 2000 € | Dříč – to, co potřebuje 80 % víceuzlových specifikací Kentina |
| 200 GbE | Frontier training, třída 70B+, hustý allreduce | 2500 € - 4000 € | Nedostatečně využívaná střední vrstva; kompatibilní s QSFP56 / QSFP-DD |
| 400 GbE | Trénování s více racky, hyperscale-adjacent, horká cesta k datové sadě | 5500 € - 9000 € | Skutečné náklady – pouze pokud dokážete, že je grafická karta zvládne |
| 800 GbE | Špičkové rozvaděče B200/MI355, dnes většinou hyperscalery | € 11000 + | Oblast ConnectX-8 / Thor Ultra; vzácné mimo špičku |
Tři věci, které je třeba internalizovat:
- 25 GbE není určeno pro AI fabric. Slouží pro všechno kolem – administraci, telemetrii, propojení s úložným serverem, když úložiště není na stejné RDMA fabric. Označování 25 GbE za „vrstvu AI“ naznačuje, že dodavatel nezná danou pracovní zátěž.
- 100 GbE je upřímná základní úroveň pro více uzlů. Pod touto hodnotou gradientní synchronizace zastavuje každou iteraci. Nad ní je otázkou, zda vaše GPU dokáží produkovat data dostatečně rychle, aby se drát nasytil. Pro systémy s jedním uzlem 5090 / RTX Pro 6000 Blackwell, které vykonávají náročnou práci, obvykle stačí 100 GbE.
- 400 GbE se vyplatí pouze při skutečném multirackovém tréninku. Dva uzly s 8 GPU, které provádějí jemné doladění 70B dat, to nepotřebují. Šestnáct uzlů, které provádějí předtrénování na tokenizovaném textu, ano.
800 GbE existuje, křemík se dodává (ConnectX-8, Thor Ultra), ale v současné době se jedná o hyperškálování a nasazení na úrovni třídy B200. Zmíněno pro úplnost; je nepravděpodobné, že byste ho specifikovali v sestavení Kentina v roce 2026.
Rodiny NIC, které skutečně dodávají
Trh síťových karet v roce 2026 bude ovládat řada ConnectX od společnosti NVIDIA, zbytek pokrývají Broadcom a Intel. Marvell, AMD/Pensando a hrstka Broadcomů s přejmenováním na OEM existují, ale v seznamech Kentina se objevují jen zřídka.
| NIC | maximální rychlost | PCIe | Poznámky / typická role |
|---|---|---|---|
| Intel E810-CQDA2 | 2×100GbE | Gen 4 x16 | Nejlevnější a důvěryhodný 100 GbE; spolehlivý ice ovladač; podporováno RoCE v2 |
| Mellanox ConnectX-6 Dx | 2×100GbE | Gen 4 x16 | Pracovní stroj pro 100 GbE na hostitelích Gen 4; vyspělý RoCE |
| Mellanox ConnectX-7 | 1–2 × 200/400 GbE nebo NDR IB | Gen 5 x16 | Duální IB/Ethernet; aktuální špičková specifikace Kentina pro seriózní víceuzlové systémy |
| Broadcom Thor 2 | 2 × 200/400 GbE | Gen 5 x16 | Podniková třída, RoCE v2, používaná v OEM rebrandingových SKU |
| Síťová karta NVIDIA BlueField-3 SuperNIC | 1–2 × 400 GbE | Gen 5 x32 | 16jádrový procesor Arm DPU; RoCE, NVMe-oF, odlehčení šifrování; drahé |
| NVIDIA ConnectX-8 | 1 × 800 / 2 × 400 GbE | Gen 6 x16 | Nejnovější; páruje se se Spectrum-X 800; pro napájení je potřeba PCIe Gen 6 |
| Broadcom Thor Ultra | 1×800GbE | Gen 6 x16 | Kompatibilní s UEC-1.0; síťová karta s umělou inteligencí bez nutnosti instalace; cílové horizontální škálování 100 000+ XPU |
Upřímné tipy pro práci na úrovni Kentino:
- Intel E810-CQDA2 když zákazník chce 100 GbE s omezeným rozpočtem a akceptuje, že ladění RoCE je pracnější než u Mellanoxu. Zhruba 700–900 EUR na ulici.
- ConnectX-6 Dx pro jakékoli 100GbE spojení, které potřebuje spolehlivě provozovat RoCE. Příplatek 1100–1500 EUR. Odpověď na 90 %.
- ConnectX-7 Pokud je platforma PCIe Gen 5 a 200 nebo 400 GbE, je to opodstatněné skutečným tréninkem pro více uzlů. Jednoportová karta OSFP NDR400 se prodává kolem 1650 EUR a ve firmwaru přepíná mezi IB a Ethernetem – což je užitečné, pokud byste později migrovali fabric.
- BlueField-3 a ConnectX-8 existují; pokud je odhadujete, nečtete tento článek.
PCIe je tichý strop. 100GbE síťová karta ve slotu Gen 3 x8 běží rychlostí linky a poloviční rychlostí. Pravidlo:
| Rychlost síťové karty | Minimální PCIe | Pohodlný slot |
|---|---|---|
| 25 GbE | Gen 3 x4 | Gen 4 x4 nebo Gen 3 x8 |
| 100 GbE | Gen 4 x8 nebo Gen 3 x16 | Gen 4 x16 |
| 2×100 GbE | Gen 4 x16 | Gen 5 x8 nebo Gen 4 x16 |
| 200 GbE | Gen 5 x8 nebo Gen 4 x16 | Gen 5 x16 |
| 400 GbE | Gen 5 x16 | Pouze 5. generace x16 |
| 800 GbE | Gen 6 x16 nebo 2× Gen 5 x16 | Pouze 6. generace x16 |
Na platformách Kentino EPYC s 8 GPU zabírají GPU většinu slotů Gen 4/5 x16; síťová karta je v některých konfiguracích umístěna v Gen 4 x8. To je v pořádku pro jeden 100GbE port, pro dva je to marginální. Před citací si to ověřte. W02 (PCIe linky a topologie) je podrobnější verze tohoto článku.
Kovové a optické možnosti – DAC, AOC, optika
Tři způsoby, jak vytvořit fyzické spojení, které se liší řádovou cenou. Kupující utrácejí skutečné peníze za optiku tam, kde by DAC fungoval.
| Volba | Dosah (100 GbE) | Dosah (400 GbE) | Cena za linku (100 GbE) | Cena za linku (400 GbE) | Výkon / latence |
|---|---|---|---|---|---|
| DAC (pasivní měď) | 1–3 m, ≤5 m s aktivními variantami | ≤2 m praktická, ≤3 m pasivní | 50 € - 150 € | 200 € - 400 € | ~0 W, sub-ns/m |
| AOC (aktivní optický) | Typicky 3–30 m, až 100 m | 3–30 m, max. 100 m | 200 € - 500 € | 600 € - 1200 € | 2–4 W na konec, ~5 ns/m |
| Optika SR + MMF | 70 m na OM3 / 100 m na OM4 / 150 m na OM5 | typicky 30–100 m (SR4 / SR8) | 400–800 € za pár + vlákno | 1500–2500 € za pár + vlákno | 3–4.5 W na konec |
| Optika LR + SMF | až 10 km | až 10 km | 800–1500 € za pár + vlákno | 2500–4000 €+ pár + vlákno | 3.5–5 W na konec |
Pravidla platná pro všechny dodavatele:
- DAC uvnitř jednoho racku. Pasivní měděné vodiče u 100GBASE-CR4 jsou spolehlivé do 3 m, u aktivních variant je specifikováno do 5 m. Praktický limit je 400G (100G PAM4 na kanál). 2 m pasivní — Existují 3m DAC převodníky, ale integrita signálu se při ohybech kabelu stává křehkou.
- AOC pro běhy na 5–30 m, zejména mezi sousedními racky. Transceiver je připojen k optickému vláknu, takže špatný konec znamená zničení celého kabelu.
- Optika SR + MMF pro vedení v místnostech delší než 30 m nebo tam, kde již existuje strukturovaná kabeláž. OM5 nabízí při rychlosti 100 GbE SR o přibližně 50 % větší dosah než OM4 a je to právě to, co byste měli sáhnout u nových instalací ještě dnes.
- Optika LR + SMF pro křížení budov nebo místností. Nadměrná zátěž uvnitř jednoho 4rackového clusteru.
Matematika délky kabelů pro cluster se 4 racky. Řada čtyř 42U racků, každý o šířce ~600 mm s ~100 mm mezerou mezi racky. Přepínač v horní části racku v horní části racku 1 k síťové kartě v dolní části racku 4: ~2.1 m horizontálně + ~2 m vertikálně = ~4 m běhu s rezervou. Při 100 GbE jste na hranici DAC; při 400 GbE jste za ní. Pro jakýkoli cluster širší než ~2 racky při 400 GbE naplánujte AOC nebo optiku. Toto je nejčastější chyba ve specifikacích u nabídek pro více racků – za předpokladu, že DAC dosáhne, protože „racky jsou hned vedle sebe“.
Komplexní 100GbE spojení, 2m intra-rackový hop, polovina roku 2026: pár ConnectX-6 Dx ~2400 EUR + dva porty přepínače s amortizací ~1500 EUR + 2m QSFP28 DAC ~90 EUR = ~4000 EUR za spojení . Stejné spojení s rychlostí 400 GbE (pár ConnectX-7, 400GbE porty přepínače, 2m QSFP-DD DAC) stojí zhruba 14 000 EUR – 4× větší šířka pásma za ~3.5× vyšší náklady. Ekonomická stránka je rozumná; otázkou je, zda si to daná pracovní zátěž vyžaduje.
Přepnout na šířku
Trh s ethernetovými přepínači s umělou inteligencí v roce 2026 se dělí do tří zřejmých kategorií.
| Třída | Příklady | Latence na port | Poznámky |
|---|---|---|---|
| AI horní část racku (průřez, hluboký vyrovnávací paměť) | NVIDIA Spectrum-X SN5600 (64×800 GbE / 51.2 Tb/s), Arista 7060X4 (32×400 GbE, ~700 ns), řada Cisco Nexus 9300 | 400–700 ns | Bezztrátové šablony RoCE, PFC/ECN ihned po vybalení, testováno AI fabric |
| Modulární páteř | Arista 7800R3 (až 36×400 GbE na linkovou kartu), Cisco Nexus 9500 | 1–3 µs v závislosti na linkové kartě | Pro clustery s 16 a více uzly; směrovaná páteřní síť Clos |
| Generický / bílý box | Třída Tomahawk se SONiC, Dell PowerSwitch a Mikrotik pro nižší třídu | liší se, 600 ns – 3 µs | Levnější, více konfigurační práce, ladění RoCE je vaše práce |
Dvě názorová rozhodnutí:
- Pro trénovací clustery se 4 až 8 uzly a rychlostí 100 nebo 400 GbE je správnou odpovědí jeden Spectrum-X SN5600 nebo Arista 7060X4. Jeden přepínač, jedna doména selhání, žádné uzavření, šablony RoCE dodávané dodavatelem. SN5600 je 64×800 GbE v provedení 2U s agregovanou rychlostí 51.2 Tb/s a hlubokými vyrovnávacími pamětí vyladěnými umělou inteligencí; 7060X4 vám nabízí 32×400 GbE v provedení 1U s latencí ~700 ns za znatelně nižší cenu, pokud nepotřebujete 800 GbE.
- Pro 16 a více uzlů naplánujte směrování L3 Clos. se dvěma trny, BGP nečíslovaný mezi listy a trny, ECMP napříč trny. N08 pokrývá mechaniku uplinku; N04 pokrývá volbu topologie.
MTU a jumbo rámce
Výchozí hodnota MTU pro Ethernet je 1500 bajtů. Při rychlosti 100 GbE to představuje přibližně 8.3 milionu paketů za sekundu na stream, přičemž každý z nich platí náklady jádra na paket. MTU 9000 snižuje rychlost paketů 6×, odpovídajícím způsobem snižuje zátěž CPU a je v podstatě povinná pro jakoukoli strukturu umělé inteligence.
Konkrétně pro RoCEv2 se MTU ve stylu IB vybírá z největší velikosti, která se vejde do ethernetové MTU. Ethernet o velikosti 9000 bajtů dává RoCE MTU 4096 bajtů – hodnotu, kterou očekává každý stack NCCL a RDMA. Pokud zůstanete na 1500, získáte RoCE MTU 2048 bajtů a znatelnou ztrátu výkonu na každém kolektivu.
Tři věci, které je třeba vědět:
- Musí se shodovat od začátku do konce. Jediné zařízení s kapacitou 1500 MTU v cestě tiše fragmentuje a snižuje propustnost. Nastavte ho na každou síťovou kartu, každý port přepínače a každý routerový hop v síti AI VLAN.
- Udržujte jumbo omezené na AI VLAN. Vaše firemní síť nebude bez problémů provozovat MTU 9000. Řídicí rovina zůstane na 1500.
-
Ověřte u
ip linkatracepath, ne důvěrou v konfiguraci. Počet clusterů, kde někdo nastavil na síťových kartách hodnotu 9000 a zapomněl porty přepínače, je trapný.
Ztrátový vs. bezztrátový Ethernet – náhled
Obyčejný TCP/IP přes Ethernet je ztrátový : přepínače zahazují pakety, když se fronty naplní, TCP se znovu odesílá, propustnost klesá. Vhodné pro streamování webového provozu, ale fatální pro RDMA – ztráta jediného paketu v RoCE allreduce ukončí celý přenos a donutí NCCL vypršet časový limit.
Řešením je bezztrátový Ethernet , kterého se dosahuje společnými silami dvou mechanismů:
- PFC (řízení prioritního toku, 802.1Qbb) — pauza podle priority. Když se vyrovnávací paměť přepínače pro prioritu 3 (konvenčně priorita RDMA) zaplní, odešle rámec pauzy na port proti proudu. Krátkodobá nouzová brzda.
- ECN (Explicitní oznámení o dopravní zácpě) — přepínače označují pakety ve frontách, které se plní, přijímač odesílá zpět CNP, odesílatel zpomaluje. Dlouhodobá kontrola zahlcení.
Společně tvoří DCQCN – Data Center Quantized Congestion Notification – což je standardní řídicí smyčka RoCEv2 na moderních ethernetových sítích s umělou inteligencí. ECN vykonává většinu práce, PFC se spustí pouze tehdy, když ECN nedokáže reagovat dostatečně rychle.
Ponaučení z tohoto článku: pokud používáte RoCE, váš přepínač musí podporovat PFC a ECN na prioritě RDMA a vaše síťová karta musí být nakonfigurována tak, aby je označovala/respektovala. Zakoupení přepínače od dodavatele s dokumentovanými šablonami RoCE (NVIDIA Spectrum, Arista, Cisco Nexus 9000) ušetří týden konfigurace. Článek N02 se zabývá srovnáním s InfiniBand; článek N07 se podrobně zabývá kontrolou přetížení.
Hloubka vyrovnávací paměti – mělká vs. hluboká
Druhou osou u přepínačů AI je hloubka vyrovnávací paměti. AllReduce je v každé iteraci typu mnoho k jedné – každý uzel v kruhu nebo stromu konverguje k jednomu uzlu ve stejném okamžiku. To je incast a drtí přepínače s mělkou vyrovnávací pamětí.
- Přepínače s mělkou vyrovnávací pamětí (starší Tomahawk, generický Enterprise) mají celkem 4–32 MB vyrovnávací paměti. Levné, s nízkou latencí, vhodné pro provoz východ-západ v podnikové síti. Zahazuje pakety při prvním příjmu incastu.
- Přepínače umělé inteligence s hlubokou vyrovnávací pamětí (Jericho3-AI, Spectrum-X, některé linkové karty 7800R3) mají stovky MB až několik GB vyrovnávací paměti. Absorbují shluky incastů a zadržují pakety, zatímco DCQCN snižuje počet odesílatelů.
Pro cluster se 2 uzly je hloubka vyrovnávací paměti irelevantní. Pro 8 a více uzlů s hustou allreduce funkcí představují hluboké vyrovnávací paměti rozdíl mezi zdravou fabricou a takovou, která propouště pauzy a zastavení PFC. To je skutečný důvod, proč si pořídit přepínače třídy AI spíše než generické přepínače.
Upřímný názor – týká se to i vaší sestavy?
Jednouzlový server Kentino K-AI provádějící inferenci nebo jemné ladění jednoho uzlu nic z toho nepotřebuje . GPU komunikují přes PCIe a NVLink; ethernetové připojení slouží pro vstupní signály, výstupní signály a čtení datových sad. Dva 25GbE SFP28 porty na integrované síťové kartě hostitele jsou dostačující.
Toto čtete, protože plánujete dva nebo více uzlů. Matice:
- 1 uzel: 10 nebo 25 GbE integrované. Bez upgradu.
- 2–4 uzly, jemné doladění: 100 GbE přes ConnectX-6 Dx, jeden přepínač, konfigurace RoCE. ~4 000 EUR za linku.
- 4–8 uzlů, více než 70 miliard trénovacích dat: 100 nebo 200 GbE s ConnectX-7, pokud je k dispozici PCIe Gen 5. Jeden přepínač Spectrum-X SN5600 nebo Arista 7060X4.
- 8–16 uzlů, hustý trénink: 200 nebo 400 GbE, směrované L3 Clos se dvěma páteřními kanály, přepínače s hlubokou vyrovnávací pamětí.
- 16+ uzlů: mimo typickou sestavu Kentina. Použijte referenční architekturu NVIDIA (Spectrum-X, BlueField-3 nebo ConnectX-8) a konzultanta.
Co dělat dál
Před podpisem síťové části cenové nabídky odpovězte písemně:
- Kolik uzlů bude ve skutečnosti běžet společně? Ne „později“, ne „možná“. Tím se určuje velikost úrovně.
- Jaká je největší tréninková zátěž, kterou budete provádět od začátku do konce? Předtrénování LLM pro token-text vyžaduje málo šířky pásma; difúze obrázků/videí vyžaduje hodně šířky pásma.
- Je RoCE na stole? Pokud ano, vyberte si síťové karty Mellanox a dodavatele se šablonami RoCE. Pokud ne, Intel E810 je v pořádku a o 500 eur levnější na hostitele.
- Jaká je skutečná délka kabelu od serveru k přepínači? Měřte páskou, neodhadujte. Limity DAC při 100G/400G jsou přísné.
- Oddělili jste správu od datové roviny? Vždy dvě fabric – levná 1/10 GbE pro SSH/IPMI/Prometheus a drahá RDMA fabric pouze pro NCCL. N08 má rozvržení.
- Má hostitel PCIe linky? 400GbE síťová karta ve slotu Gen 4 x16 v praxi poskytuje ~200 GbE. Před cenovou nabídkou si to ověřte.
Křížové odkazy v N tracku pro další vrstvu detailů: N02 (InfiniBand vs. RoCE vs. prostý Ethernet – kdy alternativa k Ethernetu skutečně zvítězí), N04 a N05 (přepínané a nepřepínané topologie pro případ s více uzly), N06 (disekce latence – kam mikrosekundy skutečně jdou) a N08 (nastavení RDMA v praxi a jak se cluster připojuje ke zbytku světa).
Ethernet pro umělou inteligenci je vyřešitelný problém. Chyby, které vás zaskočí, se téměř nikdy netýkají kabeláže – jde o zadání nesprávné úrovně pro danou zátěž, umístění síťové karty do nesprávného slotu PCIe nebo o zacházení s přepínačem jako s komoditou, když daná zátěž ve skutečnosti potřebuje hluboké vyrovnávací paměti a PFC. Pokud tyto tři věci uděláte správně, síť bude nudnou částí sestavení, což je přesně to, co chcete.
Toto je součást Kentino Wiki, referenční série o výpočetní technologii s využitím umělé inteligence, robotice a systémech, které je propojují. Komentáře a opravy vítány na adrese info@kentino.com.