InfiniBand vs. RoCE vs. Plain Ethernet: Výběr fabric v roce 2026

V každé poptávce po víceuzlovém clusteru s umělou inteligencí se zobrazují tři možnosti transportu: InfiniBand, RoCE a prostý TCP/IP Ethernet. Nejedná se o tři body na stejné přímce. Jsou to tři různé inženýrské filozofie – bezztrátově navržená HPC fabric, bezztrátově laděný Ethernet a běžný síťový stack, který používá zbytek výpočetní techniky – a ty mají různé nákladové křivky, různé provozní nároky a velmi odlišné správné odpovědi v závislosti na tom, co vlastně stavíte.

Tento článek probere, co každý z nich představuje, kam ve skutečnosti půjde latence a peníze v roce 2026 a kde je hranice mezi „potřebujeme RDMA“ a „potřebujeme konkrétně RDMA a InfiniBand“. Na závěr uvedeme plochou rozhodovací matici.

Cílové publikum: lidé, kteří dimenzují cluster umělé inteligence s 2 až 32 uzly a snaží se rozhodnout, zda je položka pro přepínač InfiniBand poctivá, nebo divadelní. Křížový odkaz N01 pro základní informace o 25/100 GbE, N06 pro základní rozpočet latence, N07 pro směrovací knoflíky a N08 pro praktické zprovoznění RDMA.

Tři látky, co každá z nich vlastně je

Nativní InfiniBand je účelově navržená HPC struktura. Linková vrstva je bezztrátová – řízení toku na bázi kreditů znamená, že odesílatel nikdy nevysílá, pokud příjemce nemá vyrovnávací paměť, takže pakety nejsou zahazovány při přetížení, jako je zahazuje Ethernet. Směrování je centralizované: každá struktura má správce podsítě (podsíťový manažer). opensm proces nebo vestavěný SM na spravovaném přepínači), který přiřazuje LID, vypočítává cesty a překonfiguruje při změně topologie. Aplikační plochu tvoří slovesa API — ibv_post_send, páry front, fronty dokončení, paměťové oblasti – stejné API, které si vypůjčil zbytek světa RDMA.

V roce 2026 bude nasazena generace NDR (400 Gb/s na port, přepínače ConnectX-7, Quantum-2). XDR (800 Gb/s, ConnectX-8, Quantum-X800) se letos začne dodávat do hyperškálovacích systémů a laboratoří s umělou inteligencí; IBTA zveřejnila specifikaci XDR v roce 2023 a křemík je nyní ve velkém. Latence přepínání přepínačů je u křemíku s technologií NDR cut-through pod 100 ns – což je nejnižší komerčně dostupná hodnota a za poslední dvě desetiletí je na této úrovni zhruba čtyřnásobně nižší.

RoCEv2 (RDMA přes konvergovaný Ethernet, verze 2) je stejné API RDMA verbs běžící na UDP/IP přes Ethernet. Síťový křemík je na zařízení ConnectX-7 nebo ConnectX-8 úplně stejný čip jako verze InfiniBandu — příznak firmwaru (LINK_TYPE_P1 = 1 pro IB, 2 (pro Ethernet) přepíná mezi režimy. Co není zdarma: Ethernet je ve výchozím nastavení ztrátový a RDMA předpokládá bezztrátový přenos. Nasazení RoCE tedy vyžaduje, aby se fabric choval na linkové vrstvě jako InfiniBand, což znamená Priority Flow Control (PFC) pro krátkodobou nouzovou brzdu, ECN pro signál dlouhodobého přetížení a řídicí smyčku, jako je DCQCN, která je spojuje. To je konfigurační práce – a provozní riziko – které odděluje RoCE od prostého Ethernetu. Pokud se RoCEv2 provede správně, je na dostřel latence InfiniBand: 1.5–2.5 µs RDMA RTT na stejném přepínači oproti ~1 µs u IB.

Zbytek planety tvoří obyčejný TCP/IP Ethernet . Sockets API, síťový stack kernelu, žádný RDMA, žádná záruka bezztrátového provozu. Výkon se pohybuje v pásmu latence 10–30 µs/cesta na N06 , propustnost je v pořádku s rychlostí linky NIC pro hromadný přenos a CPU je na datové cestě. Toto je správná struktura pro provoz správy, stahování modelů, telemetrii a gigabitové připojení mezi robotem a inferenčním serverem. Je to špatná struktura pro synchronní gradientní AllReduces napříč 16 GPU.

Srovnání titulků

Vlastnictví InfiniBand NDR RoCEv2 (100 GbE) Jednoduchý TCP 100 GbE
Rychlost na port (mainstream 2026) 400 Gb / s 100–400 Gb/s 100 Gb / s
Stejný přepínač RDMA RTT, 64 B ~1 µs 1.5–2.5 µs neuvedeno (bez RDMA)
Latence přepínání přeskakování <100 ns 400–600 ns 400 ns – 3 µs
Sockety RTT (zásobník jádra) n / a n / a 20–60 µs
Bezztrátová linková vrstva Ano, záměrně Vyladěno (PFC + ECN) Ne
Směrování SM, deterministický ECMP + adaptivní ECMP / standard L2/L3
Křemík síťové karty ConnectX-7/8 ConnectX-7/8 (stejný čip) Žádný
Relativní náklady na port ~$$$ ~$$ ~$
Provozní složitost Střední (SM, ale s několika knoflíky) Vysoká (ladění PFC/ECN/DCQCN) Nízké
Koncentrace dodavatelů Pouze NVIDIA NVIDIA, Broadcom, AMD/Pensando, Cisco, Arista Někdo

Řádek o nákladech čtete relativně, nikoli absolutně. Skutečný rozdíl u přepínačů je zhruba 2–3× na port pro přepínač InfiniBand NDR oproti ekvivalentnímu ethernetovému přepínači s umělou inteligencí (Spectrum-X, Tomahawk 5/6). Samotná síťová karta je v obou režimech v podstatě stejný hardware; rozdíl je v licenci a smlouvě o podpoře.

Kam vede latence

N06 rozděluje jednu zpáteční cestu RDMA na mikrosekundy. Zkrácená verze, relevantní pro toto srovnání:

Hop InfiniBand NDR RoCEv2 100 GbE Jednoduchý TCP 100 GbE
NIC TX (slovesa) 0.3–0.5 µs 0.3–0.5 µs n / a
Přepínací hop (single) <0.1 us 0.4–0.6 µs 0.4–3 µs
Drát (10 m) 50 ns 50 ns 50 ns
Přijímač síťové karty 0.3–0.5 µs 0.3–0.5 µs n / a
Jednosměrný protokol TCP/IP jádra n / a n / a 10–30 µs
Aplikace (memcpy, serializace) 0.1–1 µs 0.1–1 µs 1–10 µs
Úplně jednosměrný, jeden spínač ~1 µs ~1.2–2 µs ~15–40 µs

InfiniBand vítězí v latenci ASIC přepínačů – to je mezera, která se stále nezaplnila. Moderní ethernetové přepínače s umělou inteligencí (Spectrum-X SN5600 / Tomahawk 5) dosahují hodnoty latence na skok v rozsahu 400–600 ns, což je dostatečně konkurenceschopné, takže napříč dvouskokovým listovým páteřím je absolutní rozdíl řádově 1 µs. To je důležité pro těsné tenzorově paralelní kolektivy. Nezáleží na tom pro čtení z úložiště nebo dávkovou inferenci.

Sloupec s prostými údaji o TCP děsí lidi, kteří znají latenci pouze ze socketů. Náklady jádra 10–30 µs/cesta jsou za paket; u malého souboru zpráv s mnoha cestami zpět se rychle hromadí. NCCL přes TCP je funkční, ale je to až krajní možnost.

Šířka pásma a realita síťové karty

V roce 2026 stejná rodina karet pokrývá InfiniBand i RoCE:

NIC režim Na port PCIe
ConnectX-6 Dx IB HDR / RoCE 100 GbE 200 / 100 Gb/s Gen4
ConnectX-7 IB NDR / RoCE 400 GbE 400 Gb / s Gen5
ConnectX-8 SuperNIC IB XDR / RoCE 800 GbE 800 Gb / s Gen6
BlueField-3 DPU IB NDR / RoCE 400 GbE + offload 400 Gb / s Gen5
Broadcom Thor 2 / Thor 3 Pouze Ethernet RoCE až 800 Gb/s Gen5/6
AMD Pensando Pollara 400 RoCE / Ultra Ethernet 400 Gb / s Gen5

Titulek: karta ConnectX-7, kterou si koupíte pro IB, je stejná karta, jakou byste si koupili pro RoCE. Katalogová cena na začátku roku 2026 se pohybuje kolem 1 500–2 200 EUR za jednoportový NDR; variantní SKU pouze předkonfiguruje firmware. Proto „přechod z IB na RoCE“ ve většině clusterů není opětovným nákupem síťové karty – jedná se o změnu firmwaru, výměnu transceiveru a změnu struktury přepínače.

Na straně AMD je Pensando Pollara 400 (nyní dodávána s platformami MI300X/MI325) první důvěryhodnou RDMA síťovou kartou od jiné firmy než NVIDIA s produkčním nasazením umělé inteligence. Broadcom v roce 2025 oznámil 800G AI síťovou kartu (generace Thor Ultra / Thor 3). Poprvé za deset let není trh RDMA síťových karet omezen pouze na jednoho dodavatele.

Přepínače: kde se peníze skutečně nacházejí

Cena síťové karty je ve všech režimech zhruba stejná. Přepínač ne.

Přepnout třídu Kapacita Přibližný seznam, na port, 2026
NVIDIA Quantum-2 QM9700 (64× 400G NDR IB) 51.2 Tb/s $$$$ (~3× ekvivalent Ethernetu)
NVIDIA Quantum-X800 (XDR IB) 115.2 Tb/s $$$$$
NVIDIA Spectrum-X SN5600 (64× 800G Eth) 51.2 Tb/s $ $ $
Referenční Broadcom Tomahawk 5 (51.2 Tb/s) 51.2 Tb/s $$
Broadcom Tomahawk 6 (102.4 Tb/s) 102.4 Tb/s $$$ (novější, prémiové)
Generický 100 GbE list (třída datových center) 6.4–12.8 Tb/s $

Prémie 2–3× na port u InfiniBand je stabilní již léta. Jsou to reálné náklady: 64portový NDR přepínač Quantum-2 se uvádí v cenovém rozmezí 120 000–180 000 EUR v závislosti na optice a podpoře; 64portový Spectrum-X SN5600 s podobným počtem portů se pohybuje kolem 60 000–90 000 EUR; generický Tomahawk 5 whitebox od tchajwanského výrobce OEM může stát polovinu této ceny. Připočtěte-li optiku – transceivery OSFP NDR stojí při objemu výroby 600–1 200 EUR – delta „celkem v přepočtu“ na port se dále rozšiřuje.

Kde se nerozšiřuje tolik , jak se očekává: AOC (aktivní optické kabely) a DAC (přímé připojení mědi) pro instalaci v racku. 3m DAC stojí v obou ekosystémech přibližně 100–200 EUR. Vysoký účet za optiku se projeví až při delší vzdálenosti přesahující přibližně 5 m a potřebě transceiverů SR/LR na obou koncích.

Úhel pohledu Spectrum-X: NVIDIA s nápisem „AI Ethernet“

Strategickou odpovědí společnosti NVIDIA na přechod na Ethernet je Spectrum-X – balíček přepínačů Spectrum-4 (a nyní Spectrum-5), síťových karet BlueField/ConnectX a komplexního řešení pro řízení přetížení, které nazývají „adaptivní směrování + vyvažování zátěže založené na telemetrii“. Marketingové tvrzení zní, že Spectrum-X poskytuje na Ethernetu výkon třídy InfiniBand AllReduce, ověřený na reálných úlohách trénování umělé inteligence.

Naměřená realita, z vlastních benchmarků NVIDIA a od třetích stran:

  • Spectrum-X zmenšuje zhruba 80–90 % rozdílu ve výkonu AllReduce oproti InfiniBand NDR u úloh NCCL. Zbývající rozdíl představují malé zprávy a nejhorší možné chování.
  • Tajnou přísadou je adaptivní směrování pro jednotlivé pakety (rozděluje pakety po více cestách a přeskupuje je u příjemce). Standardní ECMP hašuje celé toky, což u úloh umělé inteligence s malým počtem toků vytváří aktivní zóny. Spectrum-X tento předpoklad hašování toků ruší.
  • Funguje to pouze jako stack. Zkombinujte síťovou kartu od jiné firmy než NVIDIA s přepínačem Spectrum a adaptivní směrovací telemetrická cesta se přeruší. Toto je kompromis uzamčení – opustíte ekosystém InfiniBand, abyste se do něj znovu dostali přes Ethernet.

Upřímné čtení: Spectrum-X je skutečné inženýrské řešení skutečného problému. Také udržuje NVIDIA v obraze na každé vrstvě clusteru umělé inteligence, což je přesně to, čemu se hyperškálovači vyhnuli prostřednictvím Ethernetu. Zda je to správné rozhodnutí, závisí na tom, zda zbývající 10–20% výkonnostní rozdíl stojí za dodatečnou integrační svobodu, kterou obětujete.

Není-li NVIDIA řešením, je Ultra Ethernet – specifikace UEC 1.0 publikovaná v roce 2025, kterou podporují společnosti AMD, Broadcom, Cisco, HPE, Intel, Meta a Microsoft. Vícecestné doručování, vyvažování zátěže na úrovni paketů, řízení přetížení v síti, otevřené API. Pensando Pollara a Broadcom Thor 3 jsou prvními síťovými kartami dodávajícími UEC. Od poloviny roku 2026 se jedná o důvěryhodnou cestu mezi dodavateli Ethernetu a umělé inteligence, která nevyžaduje komplexní NVIDIA stack.

Kontext hyperškálování (a co to znamená pro nás ostatní)

Hlavní zpráva z posledních dvou let: hyperškáleři z velké části opustili InfiniBand. Meta vyškolila Llama 3 namísto RoCE. AI fabric od AWS je ethernetová end-to-end. TPU pody od Googlu byly vždy zakázkové, ale jejich flotily GPU jsou založeny na Ethernetu. Microsoft Azure provozuje mix a v nových sestaveních silně investuje do Ethernetu. Zhruba 70 % nových nasazení infrastruktury AI na začátku roku 2026 zvolilo Ethernet namísto InfiniBandu, jak vyplývá ze zveřejněných výsledků Broadcomu, což je obrat oproti ~80% podílu InfiniBandu v roce 2023.

Metův zveřejněný závěr byl jednoznačný: správně vyladěné RoCEv2 a InfiniBand poskytují ekvivalentní trénovací výkon při svých úlohách. Změna se netýká hrubého výkonu – jde o to, kdo vlastní křemík, kdo obsazuje SRE, jak se součástky získávají a zda se provozní model integruje se zbytkem datového centra.

Pro nás ostatní, kteří nepoužíváme trénovací fabrics s 10 000 GPU, jsou důležité tři věci:

  1. Otázka „Ethernet zvládne umělou inteligenci“ je vyřešena. Může. RoCEv2 s moderním křemíkem s umělou inteligencí a řádnou kontrolou přetížení je produkční kvality. Hyperscalery to dokázaly. Už nemusíte svou volbu obhajovat v RFQ.
  2. S křemíkem se posunula i provozní odbornost. Před pěti lety byli ve vaší zemi tři lidé, kteří dokázali sehnat InfiniBand fabric, a jeden, který dokázal správně naladit PFC/DCQCN na RoCE. Dnes jsou dovednosti v oblasti RoCE mnohem rozšířenější a dovednosti v oblasti InfiniBand jsou soustředěny v laboratořích HPC a u partnerů NVIDIA. Naplánujte si odpovídající personální obsazení.
  3. Příběh o vázanosti na dodavatele se obrátil naruby. InfiniBand byl vždy od jednoho dodavatele (NVIDIA, dříve Mellanox). Ethernet byl otevřenou alternativou – dokud Spectrum-X nepřišel s nabídkou NVIDIA end-to-end i na Ethernetu. Skutečně dodavatelsky neutrálním řešením v roce 2026 je RoCE třídy UEC s křemíkem Broadcom nebo AMD.

Kdy je InfiniBand tou správnou volbou

InfiniBand je správná odpověď, když je pravdivá většina z těchto otázek:

  • Vyhrazený trénovací cluster, 16+ uzlů, spouštění synchronního gradientu AllReduces s trvalou rychlostí. Výhoda latence na konci s malým kolektivem se projevuje napříč tisíci iteracemi.
  • Stejně si kupujete systémy NVIDIA HGX nebo DGX. Tyto základní desky jsou navrženy pro NDR/XDR. Kombinace Ethernetu na uzlu DGX je provozně nepraktická.
  • Máte odborné znalosti v rámci personálu který zná správce podsítě, umí číst ibtracert výstup a je spokojen s řízením UFM od NVIDIA.
  • Rozpočet podporuje 2–3× prémii na port přepínače aniž by se narušila ekonomika klastru.
  • Shluk je celým účelem budovy. Čisté nasazení HPC/AI bez sdílených úložných klientů a bez aplikačního provozu – InfiniBand zjednodušuje provozní model, protože není třeba argumentovat QoS.

Pokud tři z těchto pěti popisů popisují vaši konstrukci, InfiniBand si svou cenu zaslouží. Pokud ano pouze jeden, platíte za látku optimalizovanou pro problém někoho jiného.

Když je RoCEv2 pragmatickým rozhodnutím

RoCE je správnou odpovědí pro největší skupinu zákazníků společnosti Kentino:

  • 4 až 16 uzlů, smíšená pracovní zátěž, trénování, inference a ukládání na stejné struktuře.
  • Cenově dostupné, ale s požadavkem RDMA. Cluster provádí dostatek víceuzlového trénování nebo distribuované inference, takže zatížení kernelu prostého TCP je nepřijatelné, ale prémiový přepínač InfiniBand ano.
  • Sdílená struktura s provozem bez umělé inteligence. Provoz, úložiště a přístup vývojářů jsou propojeny na stejné ethernetové vrstvě. RoCE s tím koexistuje; InfiniBand potřebuje vlastní fyzickou vrstvu.
  • Chcete možnost volby dodavatele. Kombinujte přepínače Broadcom se síťovými kartami NVIDIA s uzly AMD MI300. Ekosystém Ethernet to umožňuje; ekosystém InfiniBand ne.
  • Tým již má dostatečnou operační kapacitu Ethernetu. Ladění PFC/ECN je skutečná práce, ale je to práce na substrátu, který už každý zná. SM ve vaší hlavě je řídicí rovina L2/L3, kterou používáte už léta.

Past, kterou je třeba nahlásit: Špatně nakonfigurovaný RoCEv2 je horší než obyčejný TCP. PFC pause storms napříč nesegmentovanou sítí fabric mohou narušit chod management plane. Nesprávně nastavené prahové hodnoty ECN vytvářejí fabric, který při perftestu vypadá dobře, ale při skutečném AllReduce incastu se hroutí. Podle N08 se jedná o varování „ruční rolování konfigurace PFC na generickém whiteboxu je projekt“. Kupte si od dodavatele s ověřenými šablonami RoCE (NVIDIA Spectrum-X, Arista, Cisco Nexus 9000 s profilem služby AI fabric) nebo si najměte někoho, kdo to již udělal.

Kdy stačí obyčejný Ethernet TCP/IP

Obyčejný Ethernet – žádné RDMA, žádné PFC, žádné ladění DCQCN, jen sockety a kernel stack – je správnou odpovědí častěji, než si lidé připouštějí:

  • Jednouzlový server s 4× nebo 8× GPU. Provoz mezi GPU zůstává uvnitř šasi na PCIe nebo NVLinku. Jedinou rolí sítě je odesílání trénovacích dat, modelování vážení a telemetrie. 25 GbE nebo jeden 100GbE link je v pořádku.
  • Inferenční shluky s lehkou koordinací mezi uzly. Latenci na požadavek dominují výpočty GPU; 10 µs sítě je šum.
  • Laboratoř se smíšeným využitím, robotický workbench, vývojové prostředí. Cluster neprovádí trvalé synchronní školení. RDMA je zbytečné.
  • Nastavení edge-AI v robotice jak je popsáno v I01 — robot komunikuje s jedním inferenčním serverem, latence je v řádu stovek milisekund a struktura je neviditelná.

Upřímné rozhodnutí pro většinu zákazníků Kentina: pokud si kupujete jednu grafickou kartu K-AI 256 Turin Dual s 8× RTX 5090, nepotřebujete InfiniBand a ani RoCE. Dvojice 100GbE připojení ke standardnímu přepínači datového centra, povolené jumbo snímky, výchozí ladění jádra – to je správná odpověď a stojí o pětimístnou částku méně než alternativa.

Čestný Kentino pohled

Prodáváme zákazníkům, kteří si budují clustery s 1 až 8 uzly s grafickými kartami pro spotřebitele a pracovní stanice (5090, 4090, RTX Pro 6000 Blackwell). Ne pro hyperscale trh ani pro HPC trh. Pro danou velikost:

  • Jednouzlová krabička s 8 GPU: obyčejná 25/100 GbE. Hotovo. Žádné RDMA, žádné zatížení fabric. Zajímavá šířka pásma je uvnitř šasi na PCIe Gen5; vnější spojení slouží pro příjem a správu dat.
  • Cluster se 2 až 4 uzly s občasným distribuovaným trénováním: RoCEv2 na 100 GbE s šablonou přepínače s umělou inteligencí podporovanou dodavatelem. Spectrum-X, pokud chcete cestu ověřenou společností NVIDIA; Tomahawk 5 / Arista, pokud chcete cestu s více dodavateli. Naplánujte si dva týdny na správné nastavení PFC/ECN a... nccl-tests validace.
  • Trénovací cluster se 4 až 8 uzly pro trvalé udržení: RoCEv2 na 200 nebo 400 GbE s plně oddělenou rovinou správy. Toto je ideální bod pro křivku nákladů na port; rozdíl oproti IB v tomto měřítku nestačí k ospravedlnění prémie za přepínač, pokud není pracovní zátěž neobvykle citlivá na latenci.
  • Nad 8 uzly, trvalý trénink s intenzivním využitím AllReduce: InfiniBand si začíná zasloužit zvážení. Není to automatické – změřte to. Ale při této velikosti stojí provozní jednoduchost typu „fabric je bezeztrátový, SM zvládá routování, NCCL prostě funguje“ za skutečné peníze.
  • Cokoli skutečně v měřítku DGX: my ne. Kupte si HGX a přijměte balíček InfiniBand.

Co dělat dál

Rozhodovací matice, která ukončuje většinu těchto konverzací:

Otázka Pokud ano Jestli ne
Je to server s jedním uzlem, nebo dva uzly, které pracují nezávisle na sobě? Obyčejný TCP, 25/100 GbE. Zde zastavte. Pokračovat.
Provozujete synchronní distribuované školení (DDP / FSDP / Megatron)? Pokračovat. Stačí obyčejný TCP/100 GbE. Dost.
Má cluster celkem ≤ 4 uzly? RoCEv2 na 100 GbE. Pokračovat.
Má cluster 4–16 uzlů, smíšenou pracovní zátěž a sdílenou strukturu (fabric)? RoCEv2 na 100/200/400 GbE se Spectrum-X nebo Tomahawk 5/6. Pokračovat.
Má cluster 16+ uzlů, specializované školení AI a rozpočet NVIDIA? InfiniBand NDR / XDR. RoCEv2 je stále obhajitelný.
Máte ve svém týmu odborníky na InfiniBand? IB je provozně levnější. Lean RoCEv2; trh s ethernetovými dovednostmi je mnohem hlubší.
Bude stejná struktura (fabric) přenášet provoz bez umělé inteligence (úložiště, správa, vývoj)? RoCEv2; IB vyžaduje samostatné fyzické zařízení. IB je čistší, pokud to rozpočet dovolí.

Pokud vyhodnocujete sestavení a nejste si jisti, pořadí operací je následující:

  1. Profilujte pracovní zátěž. Jaká část celkové běhové doby je v meziuzlových kolektivech oproti výpočtům na jednom uzlu? Pokud je to méně než 10 % běhové doby, volba fabric sotva pohne jehlou.
  2. Poctivě zvažte velikost clusteru. 2 uzly nejsou stejný problém jako 16 uzlů. Počet uzlů určete před zahájením výroby tkaniny.
  3. Promluvte si se dvěma dodavateli přepínačů. Získejte skutečnou cenovou nabídku na port včetně optiky. Prémie 2–3× InfiniBand není teoretická a v marketingových materiálech se neobjevuje.
  4. Naplánujte rovinu řízení samostatně, za N08Debata o datové fabrice odvádí pozornost od skutečnosti, že k fungování potřebujete také 10GbE síť pro správu, která není závislá na fabrice umělé inteligence.
  5. Pokud RoCE: vyhraďte si dva týdny na přípravu clusteru pro ladění PFC/ECN/DCQCN. Za N08, zde klastry RoCE žijí nebo umírají.

Navazující články se zabývají základy kabelových sítí ( N01 ), rozpočtem latence, z něhož vyplývá volba ( N06 ), složitostí směrování a řízení přetížení ( N07 ) a praktickým zaváděním RDMA bez ohledu na strukturu ( N08 ). Sekce K se zabývá tématy na úrovni clusterů – distribuované trénování (K02), inferenční clustery (K03) – která předpokládají, že toto rozhodnutí již bylo učiněno.

InfiniBand je v tom, co dělá, vynikající. RoCEv2 dohnal většinu nových produktů dostatečně daleko, aby zvítězil v oblasti nákladů a ekosystému. Obyčejný Ethernet je nenápadnou správnou odpovědí pro největší počet kupujících. Vyberte si ten, který vaše pracovní zátěž skutečně potřebuje, ne ten, který doporučuje prodejce.


Toto je součást Kentino Wiki, referenční série o výpočetní technologii s využitím umělé inteligence a systémů, které ji propojují. Opravy vítány na adrese info@kentino.com.