Server di calcolo AI | 128 GB GDDR7 | EPYC 512 GB

687 corone ceche
687 corone ceche IVA esclusa

Ideale per studi di intelligenza artificiale , agenzie pubblicitarie e sviluppatori di IA generativa che necessitano di generare video e immagini fotorealistici in locale, senza costi del cloud, limiti API o fughe di dati. Un singolo server sostituisce decine di Mac mini o altre workstation per l'IA a una frazione del costo totale.

Ultimo pezzo disponibile

Miglior prezzo garantito!
Aggiungi al Carrello
Server di calcolo AI | 128 GB GDDR7 | EPYC 512 GB
Server di calcolo AI | 128 GB GDDR7 | EPYC 512 GB
687 corone ceche
687 corone ceche IVA esclusa

✅ Prezzo senza IVA quando si utilizza il nostro di hosting
🎓 Formazione gratuita per principianti e avanzati
🛡️ 24 mesi di garanzia su tutti i dispositivi
⚡ Servizio espresso – riparazione rapida presso il nostro centro

Pagamento sicuro con carta

 

Prezzo comprensivo di IVA (21%)
CZK831 899
Senza IVA: 687 520 CZK  · fattura con partita IVA / numero di partita IVA · consegna entro 7 giorni
4× RTX 5090 Blackwell — 128 GB di VRAM GDDR7 totale
Test di burn-in di 12 minuti, tutte le GPU a 575 W — 0 errori
Stack di intelligenza artificiale preinstallato (vLLM, llama.cpp, PyTorch, CUDA)
Gestione remota BMC IPMI 2.0 — nessun accesso fisico
Tutto pronto: basta collegarsi ed effettuare l'accesso.
✓ PASS per il test di burn-in Blackwell sm_120 CUDA12.8 Ordine n. KE21013 AMD EPYC 7643 512 GB di RAM ECC
128 GB
VRAM totale della GPU
~ 880 T
FP16 TFLOPS
1 631 t/s
Lotto LLM
0
Errori di burn-in
generazione di contenuti tramite IA

Server per la generazione di video e immagini indistinguibili dalla realtà

128 GB di VRAM GDDR7 distribuiti su quattro GPU Blackwell consentono di eseguire i più grandi modelli di diffusione e video open-source con la massima precisione, senza offloading, quantizzazione o tempi di attesa. Nessun cloud, nessuna commissione API, nessun dato che esce dalla rete.

Preinstallato e testato
🎬

Generazione video: HunyuanVideo, Wan2.1, CogVideoX

128 GB di VRAM consentono la generazione di lunghe sequenze in alta risoluzione senza limitazioni dovute a suddivisione in riquadri o frame. Supporto completo di CUDA 12.8 per tutti i modelli video moderni.

128 GB VRAM
️

Generazione di immagini

FLUX.1, SD3.5, Cascata stabile — precisione completa FP16, batch, ControlNet, adattatore IP.

🧠

Inferenza LLM per i team

vLLM tensore-parallelo × 4 GPU — 1.631 thread/s per 64 utenti simultanei. Qwen, Llama, Mistral, DeepSeek.

Hardware

Specifiche tecniche complete

GPU (4 pezzi)
ModelloNVIDIA GeForce RTX 5090
ArchitetturaBlackwell, sm_120
VRAM sulla GPU32 GB GDDR7
VRAM totale128 GB
Streaming multi-processo.170 SM/card
larghezza di banda della memoria~1.530 GB/s / GPU
TDP575 W/GPU (4x = 2300 W)
PCIeGen4 × 16 per slot
CPU e memoria di sistema
CPUAMD EPYC 7643
Nuclei/Fibre48C / 96T
Frequenza massima3,64 GHz
Cache L3256 MiB
RAM di sistema512 GB DDR4-2666
ECCSì (RDIMM)
DIMM8× 64GB Samsung
Canali di memoria8 (completamente equipaggiato)
Scheda madre e memoria
Scheda madreASRockRack ROMED8-2T/BCM
BIOSP4.30 (20. 5. 2026)
NVMe SSDCruciale P310 2 TB
Lettura sequenziale7 MB / s
Scrittura sequenziale6 MB / s
IOPS casuali 4K467 K / 477 K bianco/nero
Cucire2× 10GbE + IPMI/BMC
TelecomandoASRock Rack BMC 3.08
Software (preinstallato)
OSUbuntu LTS 24.04.4
driver NVIDIA595.71.05 (aperto)
Driver/toolkit CUDA13.2 / 12.8
cuDNN9.10.02
PyTorch2.9.1+cu128
vLLM0.14.0
lama.cppCompilazione CUDA, sm_120
Python venv/home/logic/llm-env
potenza misurata

Risultati reali ottenuti con questa particolare macchina

Misurazione effettuata il 10/7/2026 sull'unità host dm2, ordine n. KE21013. I valori misurati non sono forniti dal produttore.

Prestazioni FP16 su GPU (8192² moltiplicatore di matrice)

Gpu 0
219,1 T
Gpu 1
221,3 T
Gpu 2
219,4 T
Gpu 3
218,3 T

Totale ~880 TFLOPS FP16 · +33% per scheda rispetto alla RTX 4090

Velocità di trasferimento della VRAM (GDDR7)

Gpu 0
1.533 GB/s
Gpu 1
1.533 GB/s
Gpu 2
1.533 GB/s
Gpu 3
1.533 GB/s

Host PCIe↔GPU: 27,6 / 28,3 GB/s (H2D / D2H)

vLLM · Qwen2.5-32B-Instruct AWQ · tensore parallelo × 4 · 64 utenti simultanei

Throughput aggregato del batch64 utenti simultanei
1 631 tok/s
ModelloQwen2.5-32B AWQ (nocciolo di marlin)
32B
Connessione GPUParallelismo tensoriale × 4 GPU
✓ tutti e 4

llama.cpp · Qwen2.5-14B Q4_K_M · 1 GPU · llama-bench

Generazione di tokenbenchmark tg128
147 tok/s
Elaborazione rapidabenchmark pp512
8 234 tok/s
QuarantacinquesimoQ4_K_M, 8,37 GiB
14,8B
7 074 MB / s
Lettura sez.
6 341 MB / s
Voce secondaria
467 K
IOPS di lettura 4K
477 K
IOPS di scrittura 4K
Affidabilità

Test di rodaggio di 12 minuti a pieno carico: 0 errori

Test di consumo energetico della GPU: moltiplicazione matriciale FP16 (8192×8192) per 720 secondi consecutivi, tutte e 4 le GPU a 575 W. ✓ PASS
Gpu 0
84 ° C
575 W 2,4 GHz
0 errori
Gpu 1
88 ° C
575 W 2,35 GHz
0 errori
Gpu 2
83 ° C
575 W 2,5 GHz
0 errori
Gpu 3
80 ° C
575 W 2,5 GHz
0 errori
Soglia di throttling RTX 5090 ≈ 90 °C · massimo misurato 88 °C (GPU 1) · nessun throttling delle prestazioni · clock SM 2,3–2,5 GHz in ogni momento · test combinato GPU + 96 thread CPU superato senza errori · registro del kernel: nessun errore Xid / NVRM / PCIe AER
Confronto con la concorrenza

Perché il nostro server invece del Mac Studio M3 Ultra da 512 GB?

Il Mac Studio M3 Ultra nella configurazione da 512 GB / 8 TB è il computer Apple single-box più potente per l'intelligenza artificiale. Tuttavia, costa circa 1.000.000 CZK: con questa cifra si potrebbero acquistare più di uno dei nostri server.

Mac Studio M3 Ultra 512 GB / 8 TB Apple BTO · CPU a 32 core · GPU a 80 core · solo macOS · senza CUDA · larghezza di banda di circa 819 GB/s
Mac Studio M3 Ultra
~1.000.000 CZK
Configurazione BTO 512 GB / 8 TB
→
Il nostro server (IVA inclusa)
831 899 CZK
Prestazioni CUDA quadruplicate, prezzo inferiore.
parametroMac Studio M3 Ultra 512GBServer con 4 schede grafiche RTX 5090 (KENTINO)
Prezzo con IVA~1.000.000 CZK più costoso831 899 CZK vincitore
Acceleratore GPUGPU M3 Ultra a 80 core · ~40–60 TFLOPS FP16 · Solo Metal4× RTX 5090 Blackwell · ~880 TFLOPS FP16 × 15+ · CUDA 12.8
Memoria VRAM/AI512 GB unificati (CPU+GPU condivise) 819 GB/s128 GB GDDR7 · ~1530 GB/s per GPU 5 volte più veloce + 512 GB di RAM ECC
Velocità LLM 32B~35–40 flussi/s · 1 utente1.631 flussi/s batch × 40+ · 64 utenti
Generazione videoMetal instabile per i modelli CUDACUDA · HunyuanVideo · Wan2.1 · supporto nativo
Utenti simultanei1–3 praticamente64+ (in parallelo tensoriale LLM)
ecosistema dell'IAmacOS / Metal / MLX · senza CUDALinux / CUDA · PyTorch · ottimizzazione · tutto
TelecomandoSSH · nessun IPMI · accesso fisico per il riavvioIPMI 2.0 · BMC · console iKVM · BIOS remoto
RitocchiMPS instabile · sconsigliatoCUDA completo, LoRA, QLoRA, FSDP

Al prezzo di un Mac Studio M3 Ultra, si ottiene un server RTX 5090 con l'ecosistema CUDA.

Il Mac Studio da 512 GB è ottimo per carichi di lavoro a utente singolo con modelli di grandi dimensioni in memoria unificata. Tuttavia, è più costoso, funziona su macOS senza CUDA, può gestire al massimo 1-3 utenti e non supporta il fine-tuning. Il nostro server è più veloce per l'inferenza batch, è pienamente compatibile con CUDA e può gestire l'intero team contemporaneamente.

Circa 15 volte più TFLOPS FP16 Oltre 64 utenti simultanei Ecosistema CUDA completo Messa a punto, LoRA, addestramento Gestione remota BMC 24 ore su 24, 7 giorni su 7
Software preinstallato

Nessuna installazione: basta collegare e accedere.

Driver NVIDIA + CUDA
595.71.05 · CUDA 13.2 / toolkit 12.8 · cuDNN 9.10
PiTorcia 2.9.1
+cu128 · sm_120 Blackwell · NCCL multi-GPU
vLLM 0.14.0
tensore-parallelo · AWQ marlin · Compatibile con API OpenAI
llama.cpp (compilazione CUDA)
sm_120 · commit c4ae9a8
pila di HuggingFace
trasformatori · acceleratore · diffusori · mozzo
Python venv
/home/logic/llm-env · modelli in /home/logic/models

⚡ Consegna e primo lancio

  • Consegna entro 7 giorni lavorativi dalla conferma dell'ordine.
  • Fattura con numero di partita IVA — IVA detraibile per le aziende
  • Cambiare immediatamente la password di sistema e la password BMC.
  • Imposta un indirizzo IP statico per il BMC sulla tua rete.
  • Configura il firewall prima di eseguire l'inferenza API
  • Utente SSH: logic (sudo) · Utente BMC: admin
  • Il consumo energetico della GPU può essere regolato tramite il comando: nvidia-smi -pl [watt]
  • Assistenza tecnica KENTINO sro — e-mail + telefono
Note tecniche Tutte le GPU funzionano su PCIe Gen4 × 16 — la piattaforma AMD EPYC 7003 / ROMED8-2T è Gen4 (nessun impatto sulle prestazioni di inferenza LLM). La RTX 5090 non ha NVLink — comunicazione multi-GPU su PCIe P2P ~24,3 GB/s (standard per questa classe). La memoria ECC della GPU non è disponibile sulla RTX 5090 consumer (prevedibile, l'ECC è sulla RAM di sistema). Benchmark misurati il ​​7/10/2026, codice prodotto KE21013, host dm2. Tutti i valori sono misurati, non riportati dal produttore.

Produttore

Pcpraha

Computer da gioco del marchio Pc Praha. La migliore soluzione nella Repubblica Ceca e nell'UE. Computer da gioco professionali, piattaforme minerarie e Asici.

Domande e risposte Domande e risposte

Fai una domanda
Non ci sono ancora domande