Kentino · Vlastní server s umělou inteligencí

NVIDIA RTX PRO 6000 Blackwell Max-Q 96 GB GDDR7 ECC

Platforma podnikové úrovně, sestavená a testovaná v EU.

€12.999,00 bez DPH · poštovné se vypočítá při platbě
Skladem — odesíláme ze skladu v EU
ISO 9001 · ověřený hardwareSklad v EU a záruka7+ let zkušeností s podnikovou umělou inteligencíTestováno zapálením před odesláním
Přehled
Nejčastější dotazy
Doprava a záruka
Blackwell · 96 GB ECC · 300 W

NVIDIA RTX PRO 6000 Blackwell Max-Q — 96 GB pro on-premise AI

Plná 96GB grafická karta Blackwell v 300W pouzdře. Stejný unifikovaný ECC VRAM pool a stejný výpočetní křemík jako 600W karta, spotřebovává polovinu energie – karta, kterou si můžete vybrat, když limitem je teplota, hluk nebo sdílená pracovní stanice.

96 GB
Paměť GDDR7 ECC VRAM
24,064
CUDA jádra
~ 1.8 TB/s
Šířka pásma paměti
300 W
Napájení desky
Přehled

96 GB unifikované paměti VRAM při 300 W

Varianta Max-Q obsahuje stejnou čipovou sadu Blackwell a stejných 96 GB ECC GDDR7 jako plně výkonná RTX PRO 6000, ale má omezený příkon na 300 W. To je důležitější, než naznačuje titulek: jedna karta pojme model třídy 70B na 4 bity kompletně v jednom unifikovaném paměťovém poolu, takže nedochází k tenzorovému paralelnímu dělení, žádnému přeskakování PCIe mezi GPU ani k dělení na oddíly. Ve srovnání se stohováním spotřebitelských karet za účelem dosažení stejné VRAM získáte paměť ECC, zlomek spotřeby energie a jeden slot místo několika.

TECHNICKÉ ÚDAJE

Technické údaje

GPU NVIDIA GB202 — Blackwell
Číslo části 900-5G153
Memory 96 GB GDDR7 ECC, 512bitová
Šířka pásma paměti ~1.8 TB/s
CUDA jádra 24,064
Tenzorová jádra 752 (5. generace) · ~2 000 TOPS INT8
RT jádra 188 (4. generace)
Rozhraní PCIe 5.0 × 16
Napájení desky 300 W (16pinový 12V-2×6)
Chlazení Aktivní ventilátor, dvouslotový
Výstupy displeje 4× DisplayPort 2.1b
Záruka 36 měsíců
Nejlepší pro

Kam se to hodí

  • Inference pro jednu kartu 70B – 96 GB uchovává 70B model s 4 bity v jednom sjednoceném fondu, bez rozdělení modelu.
  • Tiché pracovní stanice a kanceláře, kde je 600W karta příliš hlučná a zahřívaná.
  • Multi-GPU staví na omezeném energetickém rozpočtu – čtyři Max-Q karty spotřebují zhruba tolik, co dvě karty s plným výkonem.
  • Jemné ladění modelů střední velikosti, kde záleží na paměti ECC a dlouhodobé stabilitě.
  • Generování obrázků a videa s velkými modely uloženými ve VRAM.
Orientační propustnost jednoho streamu: zhruba 25–35 tok/s na 70B modelu při 4 bitech a více než 100 tok/s na 8B modelu. Uvedené hodnoty jsou orientační odhady z publikovaných externích referencí, nebyly měřeny na hardwaru Kentino – sdělte nám délku vašeho modelu a kontextu a my jej správně dimenzujeme.
otázky

Nejčastější dotazy

Jak se Max-Q liší od 600W karty?

Stejná grafická karta, stejných 96 GB ECC GDDR7, stejná šířka pásma paměti. Max-Q je omezen na 300 W místo 600 W, takže trvalá propustnost je při výpočetně náročných úlohách nižší – ale jakýkoli model, který se vejde do 96 GB, se stále vejde a kapacita VRAM je to, co obvykle rozhoduje o tom, zda model vůbec poběží.

Může jedna karta opravdu zprovoznit model 70B?

Ano. 70B model na 4 bity potřebuje zhruba 40 GB, takže se vejde 96 GB s dostatečným prostorem pro KV cache a dlouhý kontext. To je hlavní důvod, proč si vybrat tuto kartu před několika menšími.

Potřebuji paměť ECC?

Pro interaktivní práci ne. Pro bezobslužné trénovací běhy, dlouhé dávkové úlohy nebo cokoli, kde by tichá změna bitu poškodila výsledek, je ECC rozdílem mezi spolehlivým strojem a nevysvětlitelnou chybou.

Bude to pasovat na můj podvozek?

Jedná se o dvouslotovou aktivně chlazenou kartu, takže je vhodná pro standardní věžové i 4U sestavy. Ujistěte se, že máte volný slot PCIe 5.0 ×16 a 16pinový napájecí konektor 12V-2×6.

Jaký je dodací lhůta?

Tyto zboží se dodávají na objednávku – obvykle do 10–21 dnů. Dostupnost v této části se rychle mění, proto si nás před plánováním termínu vyžádejte potvrzení.

Chcete tuto kartu v hotovém stroji? Kentino sestavuje, testuje a uvádí do provozu kompletní servery a pracovní stanice s RTX PRO 6000 AI – požádejte nás o nakonfigurovanou sestavu.

Otázky, které nám kupující nejčastěji kladou před objednáním serveru.

Jak dlouho to trvá?

Stroje vyrobené z komponentů, které držíme v zásobě, expedujeme rychle; cokoli vyžadující specifickou generaci GPU závisí na dodávce. Před platbou vám sdělíme datum a pokud se pohne, raději vám to oznamujeme, než abyste se o tom dozvěděli.

Lze konfiguraci změnit před sestavením?

Téměř vždy. Grafické karty, paměť, úložiště a chlazení se volí pro každou objednávku a uvedená konfigurace je spíše výchozím bodem než pevně stanoveným balíčkem. Pokud potřebujete více VRAM, rychlejší úložiště nebo jiný přístup k chlazení, sdělte nám to před objednáním a my vám sdělíme cenovou nabídku.

Můžu si server vyzvednout osobně?

Můžete. Náš sklad je v Praze a osobní vyzvednutí je vítáno – většina lidí, kteří přijdou, využije návštěvy k prohlídce stroje s naším technikem a k položení otázek, které jsou přes e-mail nepříjemné. U objednávek v rámci České republiky se také snažíme doručit osobně a provést vás nastavením na místě.

Můžu si promluvit s někým, kdo skutečně rozumí pracovní zátěži?

Ano. Máme inženýra, který se zabývá konkrétně systémy umělé inteligence, ne běžným prodejním oddělením. Pokud se vaše otázka týká velikostí dávek, kvantizace, propojení nebo toho, kde bude vaše úzké místo, zeptejte se – tato konverzace obvykle změní konfiguraci k lepšímu.

Který model mohu v této konfiguraci provozovat?

Ano. Každý stroj je před odesláním sestaven, otestován a porovnán s reálnými úlohami umělé inteligence. Po odeslání máme již nainstalovaný a spuštěný LLM. Zapojíte ho, připojíte k síti a začnete pracovat – zbývá už jen rozhodnutí, který projekt spustí jako první.

Jak otestujete server před odesláním?

Porovnáváme to se skutečnými zátěžemi umělé inteligence, nikoli se syntetickými skóre: propustnost inference, trvalé chování při zátěži a teploty za nepřetržitého provozu. S tímto strojem získáte výsledky benchmarků, takže výkon, který vám byl slíben, je výkon, který si můžete ověřit hned první den.

Je server připraven ke spuštění, když dorazí?

Ano. Každý stroj je před odesláním sestaven, otestován a porovnán s reálnými úlohami umělé inteligence. Po odeslání máme již nainstalovaný a spuštěný LLM. Zapojíte ho, připojíte k síti a začnete pracovat – zbývá už jen rozhodnutí, který projekt spustí jako první.

Odesíláme z našeho skladu v EU. Těžké zboží může vyžadovat přepravu – kontaktujte nás pro cenovou nabídku a dodací lhůtu. Dvouletá omezená záruka s pokročilou podporou RMA; k dispozici je prodloužená záruka.

Není to přesně to, co potřebujete?

Sdělte nám svou pracovní zátěž a my tuto platformu specifikujeme podle ní – grafické karty, paměť, úložiště a chlazení budou odpovídat tomu, co skutečně používáte.