Cena s DPH (21 %)
Sk831 899
Bez DPH: 687 CZK · faktúra s IČO / DIČ · dodanie do 7 dní
4× RTX 5090 Blackwell — 128 GB GDDR7 VRAM celkom
Burn-in 12 minút, všetky GPU 575 W — 0 chýb
AI stack predinštalovaný (vLLM, llama.cpp, PyTorch, CUDA)
BMC vzdialená správa IPMI 2.0 — bez fyzického prístupu
Pripravené na spustenie – stačí pripojiť a prihlásiť sa
✓ Burn-in PASS
Blackwell sm_120
CUDA 12.8
Obj. #KE21013
AMD EPYC 7643
512 GB ECC RAM
Generovanie AI obsahu
Server pre generovanie videa a obrázkov nerozlíšiteľných od reality
128 GB GDDR7 VRAM v štyroch Blackwell GPU umožňuje spúšťať najväčšie open-source difúzne a video modely v plnej presnosti - bez offloadingu, kvantizácie alebo čakania. Žiadny cloud, žiadne poplatky za API, žiadne dáta neopúšťajú vašu sieť.
Predinštalované a otestované🎬
Generovanie videa — HunyuanVideo, Wan2.1, CogVideoX
128 GB VRAM umožňuje generovanie dlhých sekvencií vo vysokom rozlíšení bez tiling alebo frame-splitting obmedzenia. Plná CUDA 12.8 podpora pre všetky moderné video modely.
128 GB VRAM
🖼️
Generovanie obrázkov
FLUX.1, SD3.5, Stable Cascade - plná presnosť FP16, batch, ControlNet, IP-Adapter.
🧠
LLM inferencie pre tímy
vLLM tensor-parallel × 4 GPU — 1 631 tok/s pre 64 súbežných užívateľov. Qwen, Flama, Mistral, DeepSeek.
technické vybavenie
Kompletná technická špecifikácia
GPU (× 4 kusy)
ModelkaNVIDIA GeForce RTX 5090
architektúraBlackwell, sm_120
VRAM na GPU32 CZ GDDR7
Celková VRAM128 GB
Streaming multiproc.170 SM / karta
Mem. bandwidth~1 530 GB/s / GPU
TDP575 W / GPU (4× = 2 300 W)
PCIeGen4 × 16 na slot
CPU a systémová pamäť
CPUAMD EPYC 7643
Jadrá / vlákna48C / 96T
Max. frekvencia3,64 GHz
medzipamäť L3256 MiB
Systémová RAMGB-512 4 DDR2666
ECCÁno (RDIMM)
DIMM moduly8× 64 GB Samsung
Pamäťové kanály8 (plne osadené)
Základná doska a úložisko
Základná doskaASRockRack ROMED8-2T/BCM
BIOSP4.30 (20. 5. 2026)
NVMe SSDCrucial P310 2 TB
Sekvenčné čítanie7 074 MB/s
Sekvenčný zápis6 341 MB/s
Náhodné 4K IOPS467 K / 477 K č/z
Sieť2× 10 GbE + IPMI/BMC
Vzdialená správaASRock Rack BMC 3.08
Softvér (predinštalované)
OSUbuntu LTS 24.04.4
Ovládač NVIDIA595.71.05 (open)
CUDA driver / toolkit13.2 / 12.8
cuDNN9.10.02
PyTorch2.9.1+cu128
vLLM0.14.0
call.cppCUDA build, sm_120
Python vonv/home/logic/llm-env
Nameraný výkon
Reálne benchmarky z tohto konkrétneho stroja
Namerané 10. 7. 2026 na hostiteľovi dm2, objednávka #KE21013. Čísla sú namerané, nie udávané výrobcom.
FP16 výkon na GPU (8192² matmul)
Celkom ~880 TFLOPS FP16 · +33 % na kartu vs. RTX 4090
Prenosová rýchlosť VRAM (GDDR7)
PCIe hosť↔GPU: 27,6 / 28,3 GB/s (H2D / D2H)
vLLM · Qwen2.5-32B-Instruct AWQ · tensor-parallel × 4 · 64 súbežných užívateľov
Batch agregovaná priepustnosť64 súbežných užívateľov
1 631 tok/y
ModelkaQwen2.5-32B AWQ (marlin kernel)
32B
GPU zapojenieTensor-parallel × 4 GPU
✓ všetky 4
llama.cpp · Qwen2.5-14B Q4_K_M · 1 GPU · llama-bench
Generovanie tokenovtg128 benchmark
147 tok/y
Spracovanie promptupp512 benchmark
8 234 tok/y
KvantizáciaQ4_K_M, 8,37 GiB
14,8B
Spoľahlivosť
12-minútový burn-in pri plnom zaťažení — 0 chýb
GPU burn — 720 s trvalý FP16 matmul (8192×8192), všetky 4 GPU pri 575 W
✓ PASS
GPU 0 XNUMX
84 ° C
575 W · 2,4 GHz
0 chýb
GPU 1 XNUMX
88 ° C
575 W · 2,35 GHz
0 chýb
GPU 2 XNUMX
83 ° C
575 W · 2,5 GHz
0 chýb
GPU 3 XNUMX
80 ° C
575 W · 2,5 GHz
0 chýb
Throttling threshold RTX 5090 ≈ 90 °C · maximum namerané 88 °C (GPU 1) · žiadne obmedzenie výkonu · SM hodiny 2,3-2,5 GHz po celú dobu · kombinovaný test GPU + 96 CPU vlákien tiež prešiel bez chýb · kernel log: žiadne Xid / NVRM / PCI
Porovnanie s konkurenciou
Prečo náš server namiesto Mac Studia M3 Ultra 512 GB?
Mac Studio M3 Ultra v konfigurácii 512 GB / 8 TB je najsilnejší single-box Apple machine pre AI. Stojí však ~1 000 000 Sk - za túto cenu zaobstaráte viac ako jeden náš server.
Mac Studio M3 Ultra 512 GB / 8 TB
Apple BTO · 32jadrové CPU · 80jadrové GPU · macOS only · bez CUDA · ~819 GB/s bandwidth
Mac Studio M3 Ultra
~1 000 000 Sk
BTO konfigurácia 512 GB / 8 TB
→
Náš server (s DPH)
831 CZK
4× viac CUDA výkonu, nižšia cena
| Parametre | Mac Studio M3 Ultra 512 GB | 4× RTX 5090 Server (KENTINO) |
|---|
| Cena s DPH | ~1 000 000 Sk drahšie | 831 CZK víťaz |
| GPU akcelerátor | 80jadrové GPU M3 Ultra · ~40–60 TFLOPS FP16 · Metal only | 4× RTX 5090 Blackwell · ~880 TFLOPS FP16 × 15+ · CUDA 12.8 |
| VRAM / AI pamäť | 512 GB unified (CPU+GPU zdieľaná) · 819 GB/s | 128 GB GDDR7 · ~1 530 GB/s na GPU 5× rýchlejšie + 512 GB ECC RAM |
| LLM rýchlosť 32B | ~35–40 tok/s · 1 užívatel | 1 631 tok/s batch × 40+ · 64 používateľov |
| Generovanie videa | Metal · nestabilný pre CUDA modely | CUDA · HunyuanVideo · Wan2.1 · natívna podpora |
| Súbežní používatelia | 1–3 prakticky | 64+ (vLLM tensor parallel) |
| AI ekosystém | macOS / Metal / MLX · bez CUDA | Linux / CUDA · PyTorch · fine-tuning · všetko |
| Vzdialená správa | SSH · bez IPMI · fyzický prístup pre reštart | IPMI 2.0 · BMC · iKVM konzola · vzdialený BIOS |
| Doladenie | MPS nestabilný · neodporúča | Plná CUDA · LoRA · QLoRA · FSDP |
Za cenu Mac Studia M3 Ultra dostanete RTX 5090 server s CUDA ekosystémom
Mac Studio 512 GB je skvelý pre single-user workloady s obrovskými modelmi v unified memory. Ale je drahšia, beží na macOS bez CUDA, zvláda max. 1–3 používateľov a nepodporuje fine-tuning. Náš server je rýchlejší na batch inferencie, má plnú CUDA kompatibilitu a zvládne celý tím naraz.
~15× viac TFLOPS FP16
64+ súbežných užívateľov
Plný CUDA ekosystém
Fine-tuning, LoRA, training
BMC vzdialená správa 24/7
Predinštalovaný softvér
Žiadna inštalácia - stačí pripojiť a prihlásiť sa
NVIDIA Driver + CUDA
595.71.05 · CUDA 13.2 / toolkit 12.8 · cuDNN 9.10
PyTorch 2.9.1
+cu128 · sm_120 Blackwell · NCCL multi-GPU
vLLM 0.14.0
tensor-parallel · AWQ marlin · OpenAI API kompatibilný
llama.cpp (CUDA build)
sm_120 · commit c4ae9a8
HuggingFace stack
transformers · accelerate · diffusers · húb
Python vonv
/home/logic/llm-env · modely v /home/logic/models
⚡ Dodanie a prvé spustenie
- Dodanie do 7 pracovných dní po potvrdení objednávky
- Faktúra s DIČ — DPH odpočítateľné pre firmy
- Ihneď zmeňte systémové heslo a heslo BMC
- Nastavte BMC na statickú IP vo vašej sieti
- Nakonfigurujte firewall pred spustením inferencie API
- SSH užívateľ: logic (sudo) · BMC užívateľ: admin
- GPU príkon je možné regulovať: nvidia-smi -pl [watty]
- Technická podpora KENTINO sro — e-mail + telefón
Technické poznámky
Všetky GPU beží na PCIe Gen4 × 16 - platforma AMD EPYC 7003 / ROMED8-2T je Gen4 (bez vplyvu na LLM inferencie výkon). RTX 5090 nemá NVLink — multi-GPU komunikácia cez PCIe P2P ~24,3 GB/s (štandard pre túto triedu). ECC GPU pamäte nie je dostupné na spotrebiteľskom RTX 5090 (očakávané, ECC je na systémovej RAM). Benchmarky namerané 10. 7. 2026, obj. #KE21013, hostiteľ dm2. Všetky čísla sú namerané, nie udávané výrobcom.