Kentino K-AI 576 Genoa RTX PRO 6000 MAX-Q: Technická architektura, analýza výkonu a benchmarky umělé inteligence

Kentino K-AI 576 Genoa RTX PRO 6000 MAX-Q: Technická architektura, analýza výkonu a benchmarky umělé inteligence

Exponenciální růst generativní umělé inteligence, modelů s rozsáhlými jazyky programování (LLM) a vysoce věrného vykreslování vyžaduje zásadní změnu v serverové infrastruktuře. Kentino K-AI 576 Genoa je navržen jako výpočetní uzel s vysokou hustotou GPU, který spojuje hostitelské procesory AMD EPYC Genoa s 6 podnikovými akcelerátory NVIDIA RTX PRO 6000 pracujícími v energeticky optimalizovaném profilu Max-Q.

1. Kompletní specifikace systému

Systém, navržený pro přenos dat s vysokou šířkou pásma, propojuje hostitelský komplex CPU přímo s polem GPU prostřednictvím linek PCIe 5.0, které jsou podpořeny vícekanálovou pamětí DDR5.

Komponenta / Parametr Specifikace Technická poznámka
Špičkový výpočetní výkon umělé inteligence ~1 000 NEJVYŠŠÍCH (8. FP / INT8) Agregovaný výkon napříč 6násobným polem GPU s akcelerací FP8
Subsystém GPU 6x NVIDIA RTX PRO 6000 Max-Q (architektura Blackwell) Optimalizovaný poměr výkonu k tepelné stopě pro nepřetržitý provoz 24 hodin denně, 7 dní v týdnu
Vyrovnávací paměť snímků (VRAM) 288 GB GDDR6 / ECC (6x 48 GB) Propustnost paměti až 960 GB/s na GPU
Hostitelský procesor (CPU) Řada AMD EPYC 9004 (Janov) Až 96 jader / 192 vláken, patice SP5
Systémová paměť (RAM) Až 1.5 TB DDR5-4800/5200 ECC 12kanálová architektura paměti
Rozhraní sběrnice Nativní PCIe 5.0 x16 na každý slot GPU Přímé připojení CPU k GPU eliminující latenci přepínače
Úložný subsystém Až 8x NVMe U.2 / U.3 SSD disků (PCIe 4.0/5.0) Disky vyměnitelné za provozu s rychlostí sekvenčního čtení až 14 GB/s
Sítě a správa Duální 10GbE / 25GbE SFP28 + dedikované IPMI 2.0 Volitelné vysokorychlostní propojení 100G/200G InfiniBand nebo RoCE v2
Power Supply Unit 2+2 redundantní zdroje 80 PLUS Titanium Energetická účinnost přesahující 96 % při vysokém výpočetním zatížení

2. Benchmarky výkonu a syntetické umělé inteligence

Kalibrace výkonu Max-Q udržuje provozní teploty GPU striktně v rozmezí 68 °C–72 °C při trvalém plném zatížení, čímž zachovává 90 %–92 % špičkového neomezeného výkonu GPU a zároveň snižuje tepelný výkon.

2.1. Srovnávací testy hlubokého učení a inferenčních metod LLM (standard MLPerf)

Úkol / Model Metrika hodnocení K-AI 576 Performance (6x RTX PRO 6000 MQ) Relativní zisk vs. 4x RTX 4090
Lama 3 70B Propustnost tokenů (FP8) 185 tokenů/s +45 % (Vylepšená propustnost VRAM a PCIe 5.0)
Mixtral 8x22B Propustnost tokenů (FP8) 130 tokenů/s + 60%
ResNet-50 v1.5 Klasifikace obrázků (INT8) 310,000 snímků/s + 35%
Stabilní difúze XL Generování obrazu (FP16) 210 snímků/min + 50%

2.2. Srovnávací testy vizuálních výpočtů a 3D renderování (VFX / AI video)

Sada Benchmark Pracovní zátěž / testovací podmínky Výsledek K-AI 576
V-Ray GPU CUDA / RTX Skóre benchmarku pro renderování na více GPU 28 400 V-cest
Octane Render Benchmark OctaneBench 2020.1 4 120 OB
Sora / HunyuanVideo (odvození) Generování videa s umělou inteligencí v rozlišení 1080p po dobu 5 sekund ~ 14 XNUMX sekund

3. Architektura systému a tepelný management

+-----------------------------------------------------------------+
|                  AMD EPYC Genoa (Socket SP5)                    |
|             12-Channel DDR5 ECC System Memory                   |
+-----------------------------------------------------------------+
          | PCIe 5.0 x16            | PCIe 5.0 x16         | ...
          v                         v                      v
+-------------------+     +-------------------+  ...  +-------------------+
| RTX PRO 6000 MQ   |     | RTX PRO 6000 MQ   |       | RTX PRO 6000 MQ   |
| 48 GB GDDR6 ECC   |     | 48 GB GDDR6 ECC   |       | 48 GB GDDR6 ECC   |
+-------------------+     +-------------------+       +-------------------+

Klíčové architektonické výhody

  • Tepelná účinnost na úrovni racku:

    Snížení odběru energie jednotlivých grafických karet (GPU) ze standardních 300 W–350 W na 175 W–225 W snižuje celkové zahřívání šasi, čímž zabraňuje tepelnému škrcení a snižuje celkovou hodnotu PUE zařízení.

  • Přímé připojení PCIe Gen 5:

    Eliminace mezilehlých přepínačů PCIe snižuje latenci během přenosů hmotnosti velkých modelů mezi pamětí hostitelského systému DDR5 a polem GPU VRAM.

  • Předvídatelné celkové náklady na vlastnictví:

    Díky vyváženému odběru energie a sníženému tepelnému výkonu je Kentino K-AI 576 vhodný jak pro tradiční serverové rozvaděče s vysokým prouděním vzduchu, tak pro moderní podniková datová centra s uzavřenou horkou/studenou uličkou.

返回博客