Pris med moms (21%)
Kč831 899
Utan moms: 687 520 CZK · faktura med momsregistreringsnummer · leverans inom 7 dagar
4× RTX 5090 Blackwell — totalt 128 GB GDDR7 VRAM
Inbränningstid 12 minuter, alla grafikkort 575W — 0 fel
AI-stack förinstallerad (vLLM, llama.cpp, PyTorch, CUDA)
BMC fjärrhantering IPMI 2.0 — ingen fysisk åtkomst
Klar att använda – bara anslut och logga in
✓ Inbränning PASS
Blackwell sm_120
CUDA 12.8
Ordernummer KE21013
AMD EPYC 7643
512 GB ECC RAM
Generering av AI-innehåll
Server för att generera video och bilder som inte kan skiljas från verkligheten
128 GB GDDR7 VRAM över fyra Blackwell-GPU:er låter dig köra de största diffusions- och videomodellerna med öppen källkod med full noggrannhet – utan avlastning, kvantisering eller väntetid. Inget moln, inga API-avgifter, ingen data som lämnar ditt nätverk.
Förinstallerad och testad🎬
Videogenerering — HunyuanVideo, Wan2.1, CogVideoX
128 GB VRAM möjliggör generering av långa sekvenser i hög upplösning utan begränsningar för tiling eller bildrutedelning. Fullt CUDA 12.8-stöd för alla moderna videomodeller.
128 GB VRAM
🖼️
Bildgenerering
FLUX.1, SD3.5, Stabil kaskad — full precision FP16, batch, ControlNet, IP-adapter.
🧠
LLM-inferens för team
vLLM tensor-parallell × 4 GPU — 1 631 trådar/s för 64 samtidiga användare. Qwen, Llama, Mistral, DeepSeek.
hårdvara
Fullständiga tekniska specifikationer
GPU (× 4 st)
ModellNVIDIA GeForce RTX 5090
arkitekturBlackwell, sm_120
VRAM på GPU32 GB GDDR7
Totalt VRAM128 GB
Flerprocessströmning.170 SM/kort
Minnesbandbredd~1 530 GB/s / GPU
TDP575W/grafikkort (4x = 2300W)
PCIeGen4 × 16 per plats
CPU och systemminne
CPUAMD EPYC 7643
Kärnor/Fibrer48C / 96T
Maxfrekvens3,64 GHz
L3 cache256 MiB
System-RAM512 GB DDR4-2666
ECCJa (RDIMM)
DIMM-minnen8× 64 GB Samsung
Minneskanaler8 (fullt utrustade)
Moderkort och lagring
ModerkortASRockRack ROMED8-2T/BCM
BIOSP4.30 (20.5.2026)
NVMe SSDAvgörande P310 2 TB
Sekventiell läsning7 MB / s
Sekventiell skrivning6 MB / s
Slumpmässiga 4K IOPS467 K / 477 K svartvitt
Sy2× 10 GbE + IPMI/BMC
FjärrhanteringASRock-rack BMC 3.08
Programvara (förinstallerad)
OSUbuntu LTS 24.04.4
NVIDIA-drivrutin595.71.05 (öppen)
CUDA-drivrutin/verktygslåda13.2 / 12.8
cuDNN9.10.02
PyTorch2.9.1+cu128
vLLM0.14.0
call.cppCUDA-bygge, sm_120
Python venv/home/logic/llm-env
Uppmätt effekt
Riktiga riktmärken från just den här maskinen
Mätt den 10/7/2026 på värddm2, ordernummer KE21013. Siffrorna är uppmätta, de anges inte av tillverkaren.
FP16-prestanda på GPU (8192² matmul)
Totalt ~880 TFLOPS FP16 · +33% per kort jämfört med RTX 4090
VRAM-överföringshastighet (GDDR7)
PCIe-värd↔GPU: 27,6 / 28,3 GB/s (H2D / D2H)
vLLM · Qwen2.5-32B-Instruct AWQ · tensor-parallell × 4 · 64 samtidiga användare
Batchaggregerat dataflöde64 samtidiga användare
1 631 tok/s
ModellQwen2.5-32B AWQ (marlin kärna)
32B
GPU-anslutningTensor-parallella × 4 GPU:er
✓ alla 4
llama.cpp · Qwen2.5-14B Q4_K_M · 1 GPU · llama-bänk
Generera tokenstg128 riktmärke
147 tok/s
Snabb handläggningpp512 riktmärke
8 234 tok/s
KvantizaceQ4_K_M, 8,37 GiB
14,8B
6 341 MB / s
Sek. inmatning
Pålitlighet
12 minuters inbränning vid full belastning — 0 fel
GPU-förbränning — 720 s ihållande FP16-matmul (8192×8192), alla 4 GPU:er vid 575 W
✓ GODKÄND
GPU 0 XNUMX
84 ° C
575W 2,4 GHz
0 fel
GPU 1 XNUMX
88 ° C
575W 2,35 GHz
0 fel
GPU 2 XNUMX
83 ° C
575W 2,5 GHz
0 fel
GPU 3 XNUMX
80 ° C
575W 2,5 GHz
0 fel
Strypningströskel RTX 5090 ≈ 90 °C · maximalt uppmätt 88 °C (GPU 1) · ingen prestandabegränsning · SM-klocka 2,3–2,5 GHz hela tiden · kombinerat GPU + 96 CPU-trådstest klarades också utan fel · kärnlogg: inga Xid / NVRM / PCIe AER-fel
Jämförelse med konkurrenterna
Varför vår server istället för Mac Studio M3 Ultra 512 GB?
Mac Studio M3 Ultra i konfigurationen 512 GB / 8 TB är den kraftfullaste Apple-maskinen för AI i en enda låda. Den kostar dock ~1 000 000 CZK – för det här priset kan du köpa mer än en av våra servrar.
Mac Studio M3 Ultra 512 GB / 8 TB
Apple BTO · 32-kärnig processor · 80-kärnig grafikkort · endast macOS · ingen CUDA · ~819 GB/s bandbredd
Mac Studio M3 Ultra
~1 000 000 Tjeckiska kronor
BTO-konfiguration 512 GB / 8 TB
→
Vår server (inklusive moms)
831 899 CZK
4 gånger mer CUDA-prestanda, lägre pris
| Parameter | Mac Studio M3 Ultra 512 GB | 4× RTX 5090-server (KENTINO) |
|---|
| Pris med moms | ~1 000 000 Tjeckiska kronor dyrare | 831 899 CZK vinnare |
| GPU-accelerator | 80-kärniga M3 Ultra GPU:er · ~40–60 TFLOPS FP16 · Endast Metal | 4× RTX 5090 Blackwell · ~880 TFLOPS FP16 × 15+ · CUDA 12.8 |
| VRAM/AI-minne | 512 GB enhetligt (CPU+GPU delat) 819 GB/s | 128 GB GDDR7 · ~1530 GB/s per grafikkort 5 gånger snabbare + 512 GB ECC-RAM |
| LLM-hastighet 32B | ~35–40 flöden/s · 1 användare | 1 631 flöde/s sats × 40+ · 64 användare |
| Generování video | Metall instabil för CUDA-modeller | CUDA · HunyuanVideo · Wan2.1 · inbyggt stöd |
| Samtidiga användare | 1–3 praktiskt taget | 64+ (i LLM-tensorparallell) |
| AI-ekosystem | macOS / Metal / MLX · utan CUDA | Linux / CUDA · PyTorch · finjustering · allt |
| Fjärrhantering | SSH · ingen IPMI · fysisk åtkomst för omstart | IPMI 2.0 · BMC · iKVM-konsol · fjärr-BIOS |
| Finjustering | MPS instabil · rekommenderas inte | Fullständig CUDA LoRA QLoRA FSDP |
För priset av en Mac Studio M3 Ultra får du en RTX 5090-server med CUDA-ekosystemet
Mac Studio 512 GB är utmärkt för arbetsbelastningar med en enda användare med stora modeller i enhetligt minne. Men den är dyrare, körs på macOS utan CUDA, kan hantera max 1–3 användare och stöder inte finjustering. Vår server är snabbare för batchinferens, har full CUDA-kompatibilitet och kan hantera hela teamet samtidigt.
~15 gånger fler TFLOPS FP16
64+ samtidiga användare
Fullständigt CUDA-ekosystem
Finjustering, LoRA, utbildning
BMC fjärrstyrning dygnet runt
Förinstallerad programvara
Ingen installation – bara anslut och logga in
NVIDIA-drivrutin + CUDA
595.71.05 · CUDA 13.2 / verktygslåda 12.8 · cuDNN 9.10
PyTorch 2.9.1
+cu128 · sm_120 Blackwell · NCCL multi-GPU
vLLM 0.14.0
tensor-parallell · AWQ marlin · OpenAI API-kompatibel
llama.cpp (CUDA-version)
sm_120 · commit c4ae9a8
KramarAnsiktsstack
transformatorer · accelerera · diffusorer · nav
Python venv
/home/logic/llm-env · modeller i /home/logic/models
⚡ Leverans och första lansering
- Leverans inom 7 arbetsdagar efter orderbekräftelse
- Faktura med momsregistreringsnummer — momsavdragsgill för företag
- Ändra systemlösenordet och BMC-lösenordet omedelbart
- Ställ in BMC:n till en statisk IP-adress i ditt nätverk
- Konfigurera brandväggen innan du kör API-inferens
- SSH-användare: logic (sudo) · BMC-användare: admin
- GPU:ns strömförbrukning kan regleras: nvidia-smi -pl [watt]
- Teknisk support KENTINO sro — e-post + telefon
Tekniska anteckningar
Alla GPU:er körs på PCIe Gen4 × 16 — AMD EPYC 7003 / ROMED8-2T-plattformen är Gen4 (ingen påverkan på LLM-inferensprestanda). RTX 5090 har inte NVLink — kommunikation mellan flera GPU:er över PCIe P2P ~24,3 GB/s (standard för denna klass). ECC GPU-minne är inte tillgängligt på konsument-RTX 5090 (förväntat är ECC på system-RAM). Riktmärken uppmätta 10/7/2026, artikelnummer KE21013, dm2-värd. Alla siffror är uppmätta, inte rapporterade av tillverkaren.