Prezzo comprensivo di IVA (21%)
CZK831 899
Senza IVA: 687 520 CZK · fattura con partita IVA / numero di partita IVA · consegna entro 7 giorni
4× RTX 5090 Blackwell — 128 GB di VRAM GDDR7 totale
Test di burn-in di 12 minuti, tutte le GPU a 575 W — 0 errori
Stack di intelligenza artificiale preinstallato (vLLM, llama.cpp, PyTorch, CUDA)
Gestione remota BMC IPMI 2.0 — nessun accesso fisico
Tutto pronto: basta collegarsi ed effettuare l'accesso.
✓ PASS per il test di burn-in
Blackwell sm_120
CUDA12.8
Ordine n. KE21013
AMD EPYC 7643
512 GB di RAM ECC
128 GB
VRAM totale della GPU
generazione di contenuti tramite IA
Server per la generazione di video e immagini indistinguibili dalla realtà
128 GB di VRAM GDDR7 distribuiti su quattro GPU Blackwell consentono di eseguire i più grandi modelli di diffusione e video open-source con la massima precisione, senza offloading, quantizzazione o tempi di attesa. Nessun cloud, nessuna commissione API, nessun dato che esce dalla rete.
Preinstallato e testato🎬
Generazione video: HunyuanVideo, Wan2.1, CogVideoX
128 GB di VRAM consentono la generazione di lunghe sequenze in alta risoluzione senza limitazioni dovute a suddivisione in riquadri o frame. Supporto completo di CUDA 12.8 per tutti i modelli video moderni.
128 GB VRAM
️
Generazione di immagini
FLUX.1, SD3.5, Cascata stabile — precisione completa FP16, batch, ControlNet, adattatore IP.
🧠
Inferenza LLM per i team
vLLM tensore-parallelo × 4 GPU — 1.631 thread/s per 64 utenti simultanei. Qwen, Llama, Mistral, DeepSeek.
Hardware
Specifiche tecniche complete
GPU (4 pezzi)
ModelloNVIDIA GeForce RTX 5090
ArchitetturaBlackwell, sm_120
VRAM sulla GPU32 GB GDDR7
VRAM totale128 GB
Streaming multi-processo.170 SM/card
larghezza di banda della memoria~1.530 GB/s / GPU
TDP575 W/GPU (4x = 2300 W)
PCIeGen4 × 16 per slot
CPU e memoria di sistema
CPUAMD EPYC 7643
Nuclei/Fibre48C / 96T
Frequenza massima3,64 GHz
Cache L3256 MiB
RAM di sistema512 GB DDR4-2666
ECCSì (RDIMM)
DIMM8× 64GB Samsung
Canali di memoria8 (completamente equipaggiato)
Scheda madre e memoria
Scheda madreASRockRack ROMED8-2T/BCM
BIOSP4.30 (20. 5. 2026)
NVMe SSDCruciale P310 2 TB
Lettura sequenziale7 MB / s
Scrittura sequenziale6 MB / s
IOPS casuali 4K467 K / 477 K bianco/nero
Cucire2× 10GbE + IPMI/BMC
TelecomandoASRock Rack BMC 3.08
Software (preinstallato)
OSUbuntu LTS 24.04.4
driver NVIDIA595.71.05 (aperto)
Driver/toolkit CUDA13.2 / 12.8
cuDNN9.10.02
PyTorch2.9.1+cu128
vLLM0.14.0
lama.cppCompilazione CUDA, sm_120
Python venv/home/logic/llm-env
potenza misurata
Risultati reali ottenuti con questa particolare macchina
Misurazione effettuata il 10/7/2026 sull'unità host dm2, ordine n. KE21013. I valori misurati non sono forniti dal produttore.
Prestazioni FP16 su GPU (8192² moltiplicatore di matrice)
Totale ~880 TFLOPS FP16 · +33% per scheda rispetto alla RTX 4090
Velocità di trasferimento della VRAM (GDDR7)
Host PCIe↔GPU: 27,6 / 28,3 GB/s (H2D / D2H)
vLLM · Qwen2.5-32B-Instruct AWQ · tensore parallelo × 4 · 64 utenti simultanei
Throughput aggregato del batch64 utenti simultanei
1 631 tok/s
ModelloQwen2.5-32B AWQ (nocciolo di marlin)
32B
Connessione GPUParallelismo tensoriale × 4 GPU
✓ tutti e 4
llama.cpp · Qwen2.5-14B Q4_K_M · 1 GPU · llama-bench
Generazione di tokenbenchmark tg128
147 tok/s
Elaborazione rapidabenchmark pp512
8 234 tok/s
QuarantacinquesimoQ4_K_M, 8,37 GiB
14,8B
6 341 MB / s
Voce secondaria
477 K
IOPS di scrittura 4K
Affidabilità
Test di rodaggio di 12 minuti a pieno carico: 0 errori
Test di consumo energetico della GPU: moltiplicazione matriciale FP16 (8192×8192) per 720 secondi consecutivi, tutte e 4 le GPU a 575 W.
✓ PASS
Gpu 0
84 ° C
575 W 2,4 GHz
0 errori
Gpu 1
88 ° C
575 W 2,35 GHz
0 errori
Gpu 2
83 ° C
575 W 2,5 GHz
0 errori
Gpu 3
80 ° C
575 W 2,5 GHz
0 errori
Soglia di throttling RTX 5090 ≈ 90 °C · massimo misurato 88 °C (GPU 1) · nessun throttling delle prestazioni · clock SM 2,3–2,5 GHz in ogni momento · test combinato GPU + 96 thread CPU superato senza errori · registro del kernel: nessun errore Xid / NVRM / PCIe AER
Confronto con la concorrenza
Perché il nostro server invece del Mac Studio M3 Ultra da 512 GB?
Il Mac Studio M3 Ultra nella configurazione da 512 GB / 8 TB è il computer Apple single-box più potente per l'intelligenza artificiale. Tuttavia, costa circa 1.000.000 CZK: con questa cifra si potrebbero acquistare più di uno dei nostri server.
Mac Studio M3 Ultra 512 GB / 8 TB
Apple BTO · CPU a 32 core · GPU a 80 core · solo macOS · senza CUDA · larghezza di banda di circa 819 GB/s
Mac Studio M3 Ultra
~1.000.000 CZK
Configurazione BTO 512 GB / 8 TB
→
Il nostro server (IVA inclusa)
831 899 CZK
Prestazioni CUDA quadruplicate, prezzo inferiore.
| parametro | Mac Studio M3 Ultra 512GB | Server con 4 schede grafiche RTX 5090 (KENTINO) |
|---|
| Prezzo con IVA | ~1.000.000 CZK più costoso | 831 899 CZK vincitore |
| Acceleratore GPU | GPU M3 Ultra a 80 core · ~40–60 TFLOPS FP16 · Solo Metal | 4× RTX 5090 Blackwell · ~880 TFLOPS FP16 × 15+ · CUDA 12.8 |
| Memoria VRAM/AI | 512 GB unificati (CPU+GPU condivise) 819 GB/s | 128 GB GDDR7 · ~1530 GB/s per GPU 5 volte più veloce + 512 GB di RAM ECC |
| Velocità LLM 32B | ~35–40 flussi/s · 1 utente | 1.631 flussi/s batch × 40+ · 64 utenti |
| Generazione video | Metal instabile per i modelli CUDA | CUDA · HunyuanVideo · Wan2.1 · supporto nativo |
| Utenti simultanei | 1–3 praticamente | 64+ (in parallelo tensoriale LLM) |
| ecosistema dell'IA | macOS / Metal / MLX · senza CUDA | Linux / CUDA · PyTorch · ottimizzazione · tutto |
| Telecomando | SSH · nessun IPMI · accesso fisico per il riavvio | IPMI 2.0 · BMC · console iKVM · BIOS remoto |
| Ritocchi | MPS instabile · sconsigliato | CUDA completo, LoRA, QLoRA, FSDP |
Al prezzo di un Mac Studio M3 Ultra, si ottiene un server RTX 5090 con l'ecosistema CUDA.
Il Mac Studio da 512 GB è ottimo per carichi di lavoro a utente singolo con modelli di grandi dimensioni in memoria unificata. Tuttavia, è più costoso, funziona su macOS senza CUDA, può gestire al massimo 1-3 utenti e non supporta il fine-tuning. Il nostro server è più veloce per l'inferenza batch, è pienamente compatibile con CUDA e può gestire l'intero team contemporaneamente.
Circa 15 volte più TFLOPS FP16
Oltre 64 utenti simultanei
Ecosistema CUDA completo
Messa a punto, LoRA, addestramento
Gestione remota BMC 24 ore su 24, 7 giorni su 7
Software preinstallato
Nessuna installazione: basta collegare e accedere.
Driver NVIDIA + CUDA
595.71.05 · CUDA 13.2 / toolkit 12.8 · cuDNN 9.10
PiTorcia 2.9.1
+cu128 · sm_120 Blackwell · NCCL multi-GPU
vLLM 0.14.0
tensore-parallelo · AWQ marlin · Compatibile con API OpenAI
llama.cpp (compilazione CUDA)
sm_120 · commit c4ae9a8
pila di HuggingFace
trasformatori · acceleratore · diffusori · mozzo
Python venv
/home/logic/llm-env · modelli in /home/logic/models
⚡ Consegna e primo lancio
- Consegna entro 7 giorni lavorativi dalla conferma dell'ordine.
- Fattura con numero di partita IVA — IVA detraibile per le aziende
- Cambiare immediatamente la password di sistema e la password BMC.
- Imposta un indirizzo IP statico per il BMC sulla tua rete.
- Configura il firewall prima di eseguire l'inferenza API
- Utente SSH: logic (sudo) · Utente BMC: admin
- Il consumo energetico della GPU può essere regolato tramite il comando: nvidia-smi -pl [watt]
- Assistenza tecnica KENTINO sro — e-mail + telefono
Note tecniche
Tutte le GPU funzionano su PCIe Gen4 × 16 — la piattaforma AMD EPYC 7003 / ROMED8-2T è Gen4 (nessun impatto sulle prestazioni di inferenza LLM). La RTX 5090 non ha NVLink — comunicazione multi-GPU su PCIe P2P ~24,3 GB/s (standard per questa classe). La memoria ECC della GPU non è disponibile sulla RTX 5090 consumer (prevedibile, l'ECC è sulla RAM di sistema). Benchmark misurati il 7/10/2026, codice prodotto KE21013, host dm2. Tutti i valori sono misurati, non riportati dal produttore.