Preis inkl. MwSt. (21%)
CZK831
Ohne Mehrwertsteuer: 687 520 CZK • Rechnung mit Umsatzsteuer-Identifikationsnummer / Umsatzsteuer-Identifikationsnummer • Lieferung innerhalb von 7 Tagen
4× RTX 5090 Blackwell — 128 GB GDDR7 VRAM insgesamt
Einbrenntest 12 Minuten, alle GPUs 575 W — 0 Fehler
KI-Stack vorinstalliert (vLLM, llama.cpp, PyTorch, CUDA)
BMC-Fernverwaltung IPMI 2.0 – kein physischer Zugriff
Sofort startklar – einfach verbinden und einloggen
✓ Einbrenntest bestanden
Blackwell SM_120
CUDA 12.8
Bestellnummer KE21013
AMD EPYC 7643
512 GB ECC-RAM
KI-Inhaltsgenerierung
Server zur Erzeugung von Videos und Bildern, die von der Realität nicht zu unterscheiden sind
128 GB GDDR7-VRAM, verteilt auf vier Blackwell-GPUs, ermöglichen die Ausführung größter Open-Source-Diffusions- und Videomodelle in voller Genauigkeit – ohne Auslagerung, Quantisierung oder Wartezeiten. Keine Cloud, keine API-Gebühren, keine Datenübertragung aus Ihrem Netzwerk.
Vorinstalliert und getestet🎬
Videogenerierung – HunyuanVideo, Wan2.1, CogVideoX
128 GB VRAM ermöglichen die Generierung langer Sequenzen in hoher Auflösung ohne Einschränkungen durch Tiling oder Frame-Splitting. Volle CUDA 12.8-Unterstützung für alle modernen Videomodelle.
128 GB VRAM
🖼️
Bildgenerierung
FLUX.1, SD3.5, Stable Cascade — volle Präzision FP16, Batch, ControlNet, IP-Adapter.
🧠
LLM Inferenz für Teams
vLLM Tensor-Parallelverarbeitung × 4 GPU – 1.631 Threads/s für 64 gleichzeitige Benutzer. Qwen, Llama, Mistral, DeepSeek.
Hardware
Vollständige technische Spezifikationen
GPU (× 4 Stück)
ModellNVIDIA GeForce RTX 5090
ArchitekturBlackwell, sm_120
VRAM auf der GPU32 GB GDDR7
Gesamter VRAM128 GB
Multi-Prozess-Streaming.170 SM/Karte
Speicherbandbreite~1.530 GB/s / GPU
TDP575 W/GPU (4x = 2300 W)
PCIeGen4 × 16 pro Steckplatz
CPU und Arbeitsspeicher
CPUAMD EPYC 7643
Kerne/Fasern48C / 96T
Maximale Frequenz3,64 GHz
L3 Cache256 MiB
ArbeitsspeicherGB-512 4 DDR2666
ECCJa (RDIMM)
DIMMs8 × 64 GB Samsung
Speicherkanäle8 (voll ausgestattet)
Motherboard und Speicher
HauptplatineASRock Rack ROMED8-2T/BCM
BIOSP4.30 (20.5.2026)
NVMe SSDEntscheidend P310 2 TB
Sequentielles Lesen7 MB / s
Sequentielles Schreiben6 MB / s
Zufällige 4K-IOPS467 K / 477 K Schwarzweiß
Nähen2× 10GbE + IPMI/BMC
FernbedienungASRock Rack BMC 3.08
Software (vorinstalliert)
OSUbuntu LTS 24.04.4
NVIDIA-Treiber595.71.05 (offen)
CUDA-Treiber/Toolkit13.2 / 12.8
cuDNN9.10.02
PyTorch2.9.1+cu128
vLLM0.14.0
lama.cppCUDA-Build, sm_120
Python venv/home/logic/llm-env
Gemessene Leistung
Echte Benchmarks von diesem speziellen Gerät
Gemessen am 10.07.2026 auf Host dm2, Bestellnummer KE21013. Die Zahlen sind Messwerte und nicht vom Hersteller angegeben.
FP16-Leistung auf der GPU (8192² matmul)
Insgesamt ~880 TFLOPS FP16 · +33 % pro Karte im Vergleich zur RTX 4090
VRAM-Übertragungsrate (GDDR7)
PCIe Host↔GPU: 27,6 / 28,3 GB/s (H2D / D2H)
vLLM · Qwen2.5-32B-Instruct AWQ · Tensor-Parallelverarbeitung × 4 · 64 gleichzeitige Benutzer
Batch-aggregierter Durchsatz64 gleichzeitige Benutzer
1 631 tok/s
ModellQwen2.5-32B AWQ (Marlin-Kernel)
32 Mrd
GPU-VerbindungTensor-parallel × 4 GPUs
✓ alle 4
llama.cpp · Qwen2.5-14B Q4_K_M · 1 GPU · llama-bench
Tokens generierentg128 Benchmark
147 tok/s
Schnelle Bearbeitungpp512 Benchmark
8 234 tok/s
QuantisierungQ4_K_M, 8,37 GiB
14,8 Mrd
7 074 MB / s
Leseabschnitt.
6 341 MB / s
Abschnittseintrag
Verlässlichkeit
12-minütiger Einbrenntest unter Volllast – 0 Fehler
GPU-Auslastung – 720 s anhaltende FP16-Matrixberechnung (8192×8192), alle 4 GPUs mit 575 W
✓ BESTANDEN
Grafikkarte 0
84°C
575 W 2,4 GHz
0 Fehler
Grafikkarte 1
88°C
575 W 2,35 GHz
0 Fehler
Grafikkarte 2
83°C
575 W 2,5 GHz
0 Fehler
Grafikkarte 3
80°C
575 W 2,5 GHz
0 Fehler
Drosselungsschwelle RTX 5090 ≈ 90 °C · maximal gemessene Temperatur 88 °C (GPU 1) · keine Leistungsdrosselung · SM-Takt konstant 2,3–2,5 GHz · kombinierter GPU- und 96-CPU-Thread-Test ebenfalls fehlerfrei bestanden · Kernel-Log: keine Xid-/NVRM-/PCIe-AER-Fehler
Vergleich mit der Konkurrenz
Warum unser Server anstelle des Mac Studio M3 Ultra 512 GB?
Der Mac Studio M3 Ultra mit 512 GB / 8 TB ist der leistungsstärkste Apple-Rechner für KI-Anwendungen. Er kostet jedoch rund 1.000.000 CZK – für diesen Preis erhalten Sie mehrere unserer Server.
Mac Studio M3 Ultra 512 GB / 8 TB
Apple BTO · 32-Kern-CPU · 80-Kern-GPU · Nur für macOS · Kein CUDA · Bandbreite: ca. 819 GB/s
Mac Studio M3 Ultra
~1.000.000 CZK
BTO-Konfiguration 512 GB / 8 TB
→
Unser Server (inkl. MwSt.)
831 899 CZK
4-fache CUDA-Leistung, niedrigerer Preis
| Parameter | Mac Studio M3 Ultra 512 GB | 4× RTX 5090 Server (KENTINO) |
|---|
| Preis mit MwSt | ~1.000.000 CZK teurer | 831 899 CZK Gewinner |
| GPU-Beschleuniger | 80-Kern-M3-Ultra-GPUs · ~40–60 TFLOPS FP16 · Nur Metal | 4× RTX 5090 Blackwell · ~880 TFLOPS FP16 × 15+ • CUDA 12.8 |
| VRAM / KI-Speicher | 512 GB vereinheitlicht (CPU+GPU gemeinsam genutzt) 819 GB/s | 128 GB GDDR7 · ~1530 GB/s pro GPU 5x schneller + 512 GB ECC-RAM |
| LLM Geschwindigkeit 32B | ~35–40 Flows/s · 1 Benutzer | 1.631 Durchfluss/s Charge × 40+ • 64 Nutzer |
| Videogenerierung | Metall instabil für CUDA-Modelle | CUDA · HunyuanVideo · WAN 2.1 · native Unterstützung |
| Gleichzeitige Benutzer | 1–3 praktisch | 64+ (in LLM-Tensorparallelität) |
| KI-Ökosystem | macOS / Metal / MLX · ohne CUDA | Linux / CUDA · PyTorch · Feinabstimmung · alle |
| Fernbedienung | SSH · kein IPMI · physischer Zugriff für Neustart | IPMI 2.0 · BMC · iKVM-Konsole · Remote-BIOS |
| Feintuning | MPS instabil · nicht empfohlen | Vollständiges CUDA LoRA QLoRA FSDP |
Zum Preis eines Mac Studio M3 Ultra erhält man einen RTX 5090-Server mit dem CUDA-Ökosystem.
Der Mac Studio 512 GB eignet sich hervorragend für Einzelnutzer-Workloads mit großen Modellen im gemeinsamen Speicher. Er ist jedoch teurer, läuft unter macOS ohne CUDA, unterstützt maximal 1–3 Nutzer und bietet keine Unterstützung für Feinabstimmung. Unser Server ist schneller bei der Batch-Inferenz, vollständig CUDA-kompatibel und kann das gesamte Team gleichzeitig bedienen.
~15x mehr TFLOPS FP16
64+ gleichzeitige Benutzer
Vollständiges CUDA-Ökosystem
Feinabstimmung, LoRA, Training
BMC-Fernverwaltung rund um die Uhr
Vorinstallierte Software
Keine Installation erforderlich – einfach anschließen und einloggen
NVIDIA-Treiber + CUDA
595.71.05 · CUDA 13.2 / Toolkit 12.8 · cuDNN 9.10
PyTorch 2.9.1
+cu128 · sm_120 Blackwell · NCCL Multi-GPU
vLLM 0.14.0
tensorparallel · AWQ Marlin · OpenAI API-kompatibel
llama.cpp (CUDA-Build)
sm_120 · Commit c4ae9a8
HuggingFace-Stapel
Transformatoren · Beschleunigung · Diffusoren · Nabe
Python venv
/home/logic/llm-env · Modelle in /home/logic/models
⚡ Lieferung und erster Launch
- Lieferung innerhalb von 7 Werktagen nach Auftragsbestätigung
- Rechnung mit Umsatzsteuer-Identifikationsnummer – Umsatzsteuerabzug für Unternehmen
- Ändern Sie umgehend das Systempasswort und das BMC-Passwort.
- Weisen Sie dem BMC eine statische IP-Adresse in Ihrem Netzwerk zu.
- Konfigurieren Sie die Firewall, bevor Sie die API-Inferenz ausführen.
- SSH-Benutzer: logic (sudo) · BMC-Benutzer: admin
- Der Stromverbrauch der GPU kann reguliert werden: nvidia-smi -pl [Watt]
- Technischer Support KENTINO s.r.o. — E-Mail + Telefon
Technische Hinweise
Alle GPUs nutzen PCIe Gen4 × 16 – die AMD EPYC 7003 / ROMED8-2T Plattform ist Gen4 (keine Auswirkungen auf die LLM-Inferenzleistung). Die RTX 5090 verfügt nicht über NVLink – die Multi-GPU-Kommunikation erfolgt über PCIe P2P mit ca. 24,3 GB/s (Standard für diese Klasse). ECC-GPU-Speicher ist bei der Consumer-Version der RTX 5090 nicht verfügbar (erwartungsgemäß, da ECC im System-RAM enthalten ist). Die Benchmarks wurden am 10.07.2026 mit der Teilenummer KE21013 auf einem dm2-Host durchgeführt. Alle Werte wurden gemessen und nicht vom Hersteller angegeben.