Pris med mva. (21 %)
Kč831 899
Uten mva.: 687 520 CZK · faktura med MVA-nummer · levering innen 7 dager
4× RTX 5090 Blackwell — 128 GB GDDR7 VRAM totalt
Innbrenningstid 12 minutter, alle GPU-er 575 W – 0 feil
AI-stabel forhåndsinstallert (vLLM, llama.cpp, PyTorch, CUDA)
BMC fjernstyring IPMI 2.0 – ingen fysisk tilgang
Klar til bruk – bare koble til og logg inn
✓ Innbrenning PASS
Blackwell sm_120
CUDA 12.8
Ordrenummer KE21013
AMD EPYC 7643
512 GB ECC RAM
Generering av kunstig intelligens-innhold
Server for generering av video og bilder som ikke kan skilles fra virkeligheten
128 GB GDDR7 VRAM på tvers av fire Blackwell GPU-er lar deg kjøre de største diffusjons- og videomodellene med åpen kildekode med full nøyaktighet – uten avlasting, kvantisering eller venting. Ingen sky, ingen API-avgifter, ingen data som forlater nettverket ditt.
Forhåndsinstallert og testet🎬
Videogenerering — HunyuanVideo, Wan2.1, CogVideoX
128 GB VRAM muliggjør generering av lange sekvenser i høy oppløsning uten begrensninger for flislegging eller bildedeling. Full CUDA 12.8-støtte for alle moderne videomodeller.
128 GB VRAM
🖼️
Bildegenerering
FLUX.1, SD3.5, stabil kaskade — fullpresisjon FP16, batch, ControlNet, IP-adapter.
🧠
LLM-inferens for team
vLLM tensor-parallell × 4 GPU — 1631 tråder/s for 64 samtidige brukere. Qwen, Llama, Mistral, DeepSeek.
maskinvare
Fullstendige tekniske spesifikasjoner
GPU (× 4 stk.)
ModellNVIDIA GeForce RTX 5090
arkitekturBlackwell, sm_120
VRAM på GPU32 GB GDDR7
Totalt VRAM128 GB
Strømming av flere prosesser.170 SM/kort
Minnebåndbredde~1530 GB/s / GPU
TDP575 W/GPU (4x = 2300 W)
PCIeGen4 × 16 per spor
CPU og systemminne
prosessorAMD EPYC 7643
Kjerner/fibre48C / 96T
Maks. frekvens3,64 GHz
L3 cache256 MiB
System-RAM512 GB DDR4-2666
ECCJa (RDIMM)
DIMM-er8× 64 GB Samsung
Minnekanaler8 (fullt utstyrt)
Hovedkort og lagring
HovedkortASRockRack ROMED8-2T/BCM
BIOSP4.30 (20. 5. 2026)
NVMe SSD-erAvgjørende P310 2 TB
Sekvensiell lesing7 MB / s
Sekvensiell skriving6 MB / s
Tilfeldige 4K IOPS467 K / 477 K svart/hvit
Sy2× 10 GbE + IPMI/BMC
FjernadministrasjonASRock Rack BMC 3.08
Programvare (forhåndsinstallert)
OSUbuntu LTS 24.04.4
NVIDIA-driver595.71.05 (åpen)
CUDA-driver/verktøysett13.2 / 12.8
cuDNN9.10.02
PyTorch2.9.1+cu128
vLLM0.14.0
ring.cppCUDA-bygg, sm_120
Python venv/home/logic/llm-env
Målt effekt
Ekte benchmarks fra denne maskinen
Målt 10.07.2026 på vert dm2, ordrenummer KE21013. Tallene er målt, ikke oppgitt av produsenten.
FP16-ytelse på GPU (8192² matmul)
Totalt ~880 TFLOPS FP16 · +33 % per kort vs. RTX 4090
VRAM-overføringshastighet (GDDR7)
PCIe-vert↔GPU: 27,6 / 28,3 GB/s (H2D / D2H)
vLLM · Qwen2.5-32B-Instruct AWQ · tensor-parallell × 4 · 64 samtidige brukere
Gruppeaggregert gjennomstrømning64 samtidige brukere
1 631 tok/s
ModellQwen2.5-32B AWQ (marlin kjerne)
32B
GPU-tilkoblingTensor-parallelle × 4 GPU-er
✓ alle 4
llama.cpp · Qwen2.5-14B Q4_K_M · 1 GPU · llama-bench
Generering av tokenertg128-referanseindeksen
147 tok/s
Rask behandlingpp512-referanseindeks
8 234 tok/s
KvantiseringQ4_K_M, 8,37 GiB
14,8B
6 341 MB / s
Sek. oppføring
Pålitelighet
12 minutters innbrenning ved full belastning – 0 feil
GPU-forbrenning — 720 s vedvarende FP16-matmul (8192×8192), alle 4 GPU-er på 575 W
✓ BESTÅTT
GPU 0
84 ° C
575 W 2,4 GHz
0 feil
GPU 1
88 ° C
575 W 2,35 GHz
0 feil
GPU 2
83 ° C
575 W 2,5 GHz
0 feil
GPU 3
80 ° C
575 W 2,5 GHz
0 feil
Strupegrense RTX 5090 ≈ 90 °C · maksimalt målt 88 °C (GPU 1) · ingen ytelsesstruping · SM-klokke 2,3–2,5 GHz til enhver tid · kombinert GPU + 96 CPU-tråder-test bestått også uten feil · kjernelogg: ingen Xid-/NVRM-/PCIe AER-feil
Sammenligning med konkurrentene
Hvorfor vår server i stedet for Mac Studio M3 Ultra 512 GB?
Mac Studio M3 Ultra i 512 GB / 8 TB-konfigurasjonen er den kraftigste Apple-maskinen for AI i én boks. Den koster imidlertid ~1 000 000 CZK – for denne prisen kan du kjøpe mer enn én av serverne våre.
Mac Studio M3 Ultra 512 GB / 8 TB
Apple BTO · 32-kjerners CPU · 80-kjerners GPU · kun macOS · ingen CUDA · ~819 GB/s båndbredde
Mac Studio M3 Ultra
~1 000 000 CZK
BTO-konfigurasjon 512 GB / 8 TB
→
Vår server (inkludert mva.)
831 899 CZK
4 ganger mer CUDA-ytelse, lavere pris
| parameter | Mac Studio M3 Ultra 512 GB | 4× RTX 5090-server (KENTINO) |
|---|
| Pris med mva. | ~1 000 000 CZK dyrere | 831 899 CZK vinner |
| GPU-akselerator | 80-kjerners M3 Ultra GPU-er · ~40–60 TFLOPS FP16 · Kun metall | 4× RTX 5090 Blackwell · ~880 TFLOPS FP16 × 15+ · CUDA 12.8 |
| VRAM / AI-minne | 512 GB samlet (CPU+GPU delt) 819 GB/s | 128 GB GDDR7 · ~1530 GB/s per GPU 5 ganger raskere + 512 GB ECC-RAM |
| LLM-hastighet 32B | ~35–40 strømninger/s · 1 bruker | 1631 strøm/s batch × 40+ · 64 brukere |
| Videogenerering | Metall ustabilt for CUDA-modeller | CUDA · HunyuanVideo · Wan2.1 · innebygd støtte |
| Samtidige brukere | 1–3 praktisk talt | 64+ (i LLM-tensorparallell) |
| AI-økosystem | macOS / Metal / MLX · uten CUDA | Linux / CUDA · PyTorch · finjustering · alt |
| Fjernadministrasjon | SSH · ingen IPMI · fysisk tilgang for omstart | IPMI 2.0 · BMC · iKVM-konsoll · ekstern BIOS |
| Finjustering | MPS ustabil · anbefales ikke | Full CUDA LoRA QLoRA FSDP |
For prisen av en Mac Studio M3 Ultra får du en RTX 5090-server med CUDA-økosystemet.
Mac Studio 512 GB er flott for arbeidsbelastninger for én bruker med store modeller i enhetlig minne. Men den er dyrere, kjører på macOS uten CUDA, kan håndtere maks 1–3 brukere og støtter ikke finjustering. Serveren vår er raskere for batch-inferens, har full CUDA-kompatibilitet og kan håndtere hele teamet samtidig.
~15 ganger flere TFLOPS FP16
64+ samtidige brukere
Fullstendig CUDA-økosystem
Finjustering, LoRA, trening
BMC fjernstyring døgnet rundt
Forhåndsinstallert programvare
Ingen installasjon – bare koble til og logg inn
NVIDIA-driver + CUDA
595.71.05 · CUDA 13.2 / verktøysett 12.8 · cuDNN 9.10
PyTorch 2.9.1
+cu128 · sm_120 Blackwell · NCCL multi-GPU
vLLM 0.14.0
tensor-parallell · AWQ marlin · OpenAI API-kompatibel
llama.cpp (CUDA-bygg)
sm_120 · bekreft c4ae9a8
KlemmerAnsiktsstabel
transformatorer · akselerere · diffusorer · nav
Python venv
/home/logic/llm-env · modeller i /home/logic/models
⚡ Levering og første lansering
- Levering innen 7 virkedager etter ordrebekreftelse
- Faktura med MVA-nummer – MVA-fradragsberettiget for bedrifter
- Endre systempassordet og BMC-passordet umiddelbart
- Sett BMC-en til en statisk IP-adresse på nettverket ditt
- Konfigurer brannmuren før du kjører API-inferens
- SSH-bruker: logikk (sudo) · BMC-bruker: admin
- GPU-strømforbruket kan reguleres: nvidia-smi -pl [watt]
- Teknisk støtte KENTINO sro — e-post + telefon
Tekniske merknader
Alle GPU-er kjører på PCIe Gen4 × 16 — AMD EPYC 7003 / ROMED8-2T-plattformen er Gen4 (ingen innvirkning på LLM-inferensytelse). RTX 5090 har ikke NVLink — fler-GPU-kommunikasjon over PCIe P2P ~24,3 GB/s (standard for denne klassen). ECC GPU-minne er ikke tilgjengelig på forbruker-RTX 5090 (forventet er ECC på system-RAM). Referanseverdier målt 10.07.2026, delenummer KE21013, dm2-vert. Alle tall er målt, ikke rapportert av produsenten.