Preț cu TVA (21%)
Kč831
Fără TVA: 687 520 CZK · factură cu număr de TVA / număr de TVA · livrare în termen de 7 zile
4× RTX 5090 Blackwell — 128 GB GDDR7 VRAM total
Timp de rodare 12 minute, toate GPU-urile 575W — 0 erori
Stivă AI preinstalată (vLLM, llama.cpp, PyTorch, CUDA)
Administrare la distanță BMC IPMI 2.0 — fără acces fizic
Gata de utilizare — trebuie doar să vă conectați și să vă autentificați
✓ Înregistrare TRECUTĂ
Blackwell sm_120
CUDA 12.8
Comanda #KE21013
AMD EPYC 7643
512 GB RAM ECC
Generarea de conținut prin inteligență artificială
Server pentru generarea de videoclipuri și imagini imposibil de distins de realitate
Cei 128 GB de memorie VRAM GDDR7 pe patru GPU-uri Blackwell vă permit să rulați cele mai mari modele open-source de difuzie și video la precizie maximă — fără descărcare, cuantizare sau așteptare. Fără cloud, fără taxe API, nicio informație care părăsește rețeaua.
Preinstalat și testat🎬
Generare video — HunyuanVideo, Wan2.1, CogVideoX
Memoria VRAM de 128 GB permite generarea de secvențe lungi la rezoluție înaltă, fără limitări de tip tiling sau divizare a cadrelor. Suport complet CUDA 12.8 pentru toate modelele video moderne.
128 GB VRAM
🖼️
Generování obrázků
FLUX.1, SD3.5, Cascadă stabilă — precizie maximă FP16, batch, ControlNet, adaptor IP.
🧠
Inferență LLM pentru echipe
GPU vLLM tensor-paralel × 4 — 1.631 fire/s pentru 64 de utilizatori simultani. Qwen, Llama, Mistral, DeepSeek.
Piese metalice
Specificații tehnice complete
GPU (× 4 bucăți)
ModelNVIDIA GeForce RTX 5090
arhitecturăBlackwell, sm_120
VRAM pe GPU32 GB GDDR7
VRAM totală128 GB
Streaming multi-proces.170 SM/card
Lățime de bandă a memoriei~1.530 GB/s / GPU
TDP575W/GPU (4x = 2300W)
PCIeGen4 × 16 per slot
CPU și memorie de sistem
ProcesorAMD EPYC 7643
Miezuri/Fibre48C / 96T
Frecvență maximă3,64 GHz
cache-L3256 MiB
RAM-ul sistemuluiGB-512 4 DDR2666
ECCDa (RDIMM)
Module DIMM8× 64GB Samsung
Canale de memorie8 (complet echipate)
Placa de bază și stocarea
Placa de bazaASRockRack ROMED8-2T/BCM
BIOS-ulP4.30 (20.05.2026)
SSD NVMeCrucial P310 2 TB
Lectură secvențială7 MB/s
Scrierea secvenţială6 MB/s
IOPS aleatorii 4K467 K / 477 K alb/negru
A coase2× 10GbE + IPMI/BMC
Gestionare de la distanțăRack ASRock BMC 3.08
Software (preinstalat)
OSUbuntu 24.04.4 LTS
Driverul NVIDIA595.71.05 (deschis)
Driver/set de instrumente CUDA13.2 / 12.8
cuDNN9.10.02
PyTorch2.9.1+cu128
vLLM0.14.0
apel.cppCompilare CUDA, sm_120
Python venv/home/logic/llm-env
Putere măsurată
Teste de referință reale de la această mașină anume
Măsurat pe 10/7/2026 pe gazda dm2, cod comandă KE21013. Numerele sunt măsurate, nu sunt furnizate de producător.
Performanța FP16 pe GPU (8192² matmul)
Total ~880 TFLOPS FP16 · +33% per placă video față de RTX 4090
Rată de transfer VRAM (GDDR7)
Gazdă PCIe↔GPU: 27,6 / 28,3 GB/s (H2D / D2H)
vLLM · Qwen2.5-32B-Instruct AWQ · tensor-paralel × 4 · 64 utilizatori simultani
Randament agregat în loturi64 de utilizatori simultani
1 631 tok/s
ModelQwen2.5-32B AWQ (nucleu de marlin)
32B
Conexiune GPUGPU-uri tensor-paralele × 4
✓ toate 4
llama.cpp · Qwen2.5-14B Q4_K_M · 1 GPU · llama-bench
Generarea de token-uritest de referință tg128
147 tok/s
Procesare promptăpunct de referință pp512
8 234 tok/s
CuantizareQ4_K_M, 8,37 GiB
14,8B
Fiabilitate
Timp de funcționare de 12 minute la sarcină maximă — 0 erori
Consum GPU — 720 s susținut FP16 matmul (8192×8192), toate cele 4 GPU-uri la 575 W
✓ TRECE
GPU 0
84 ° C
575W 2,4GHz
0 erori
GPU 1
88 ° C
575W 2,35GHz
0 erori
GPU 2
83 ° C
575W 2,5GHz
0 erori
GPU 3
80 ° C
575W 2,5GHz
0 erori
Prag de limitare a performanței RTX 5090 ≈ 90 °C · maxim măsurat 88 °C (GPU 1) · fără limitare a performanței · frecvență de ceas SM 2,3–2,5 GHz în permanență · testul combinat GPU + 96 de fire de execuție CPU a trecut, de asemenea, fără erori · jurnal kernel: fără erori Xid / NVRM / PCIe AER
Comparație cu concurența
De ce serverul nostru în loc de Mac Studio M3 Ultra 512 GB?
Mac Studio M3 Ultra în configurația de 512 GB / 8 TB este cel mai puternic computer Apple cu un singur sistem pentru inteligență artificială. Cu toate acestea, costă ~1.000.000 CZK — pentru acest preț puteți cumpăra mai multe servere de-ale noastre.
Mac Studio M3 Ultra 512 GB / 8 TB
Apple BTO · CPU cu 32 de nuclee · GPU cu 80 de nuclee · doar macOS · fără CUDA · lățime de bandă de ~819 GB/s
Mac Studio M3 Ultra
~1.000.000 CZK
Configurație BTO 512 GB / 8 TB
→
Serverul nostru (inclusiv TVA)
831 899 CZK
Performanță CUDA de 4 ori mai mare, preț mai mic
| Parametrul | Mac Studio M3 Ultra 512GB | 4× Servere RTX 5090 (KENTINO) |
|---|
| Pret cu TVA | ~1.000.000 CZK mai scump | 831 899 CZK câştigător |
| Accelerator GPU | GPU-uri M3 Ultra cu 80 de nuclee · ~40–60 TFLOPS FP16 · Numai metal | 4× RTX 5090 Blackwell · ~880 TFLOPS FP16 × 15+ · CUDA 12.8 |
| Memorie VRAM / AI | 512 GB unificat (CPU+GPU partajat) 819 GB/s | 128 GB GDDR7 · ~1530 GB/s per GPU de 5 ori mai rapid + 512 GB de RAM ECC |
| Viteză LLM 32B | ~35–40 debit/s · 1 utilizator | Lot de 1.631 debit/s × 40+ · 64 de utilizatori |
| Generování video | Metal instabil pentru modelele CUDA | CUDA · HunyuanVideo · Wan2.1 · suport nativ |
| Utilizatori concurenți | 1–3 practic | 64+ (în paralel tensorial LLM) |
| Ecosistemul IA | macOS / Metal / MLX · fără CUDA | Linux / CUDA · PyTorch · reglaje fine · toate |
| Gestionare de la distanță | SSH · fără IPMI · acces fizic pentru repornire | IPMI 2.0 · BMC · consolă iKVM · BIOS la distanță |
| Reglaj fin | MPS instabil · nerecomandat | FSDP complet CUDA LoRA QLoRA |
Pentru prețul unui Mac Studio M3 Ultra, primești un server RTX 5090 cu ecosistemul CUDA
Mac Studio de 512 GB este excelent pentru sarcini de lucru cu un singur utilizator, cu modele uriașe în memorie unificată. Dar este mai scump, rulează pe macOS fără CUDA, poate gestiona maximum 1-3 utilizatori și nu acceptă reglaje fine. Serverul nostru este mai rapid pentru inferența în lot, are compatibilitate CUDA completă și poate gestiona întreaga echipă simultan.
~15x mai mulți TFLOPS FP16
Peste 64 de utilizatori simultani
Ecosistem CUDA complet
Reglaj fin, LoRA, instruire
Administrare BMC de la distanță 24/7
Software preinstalat
Fără instalare — doar conectați și conectați-vă
Driver NVIDIA + CUDA
595.71.05 · CUDA 13.2 / setul de instrumente 12.8 · cuDNN 9.10
PyTorch 2.9.1
+cu128 · sm_120 Blackwell · NCCL multi-GPU
vLLM 0.14.0
tensor-paralel · AWQ marlin · Compatibil cu OpenAI API
llama.cpp (compilare CUDA)
sm_120 · comite c4ae9a8
Stiva HuggingFace
transformatoare · accelerator · difuzoare · butuc
Python venv
/home/logic/llm-env · modele în /home/logic/models
⚡ Livrare și prima lansare
- Livrare în termen de 7 zile lucrătoare de la confirmarea comenzii
- Factură cu număr de TVA — TVA deductibilă pentru companii
- Schimbați imediat parola sistemului și parola BMC
- Setați BMC-ul la o adresă IP statică în rețea
- Configurați firewall-ul înainte de a rula inferența API
- Utilizator SSH: logic (sudo) · Utilizator BMC: admin
- Consumul de energie al GPU-ului poate fi reglat: nvidia-smi -pl [wați]
- Suport tehnic KENTINO sro — e-mail + telefon
Note tehnice
Toate plăcile grafice rulează pe PCIe Gen4 × 16 — platforma AMD EPYC 7003 / ROMED8-2T este Gen4 (fără impact asupra performanței inferenței LLM). RTX 5090 nu are NVLink — comunicare multi-GPU prin PCIe P2P ~24,3 GB/s (standard pentru această clasă). Memoria GPU ECC nu este disponibilă pe RTX 5090 pentru consumatori (așa cum era de așteptat, ECC se află pe RAM-ul sistemului). Teste de performanță măsurate la 10.07.2026, cod piesă KE21013, gazdă dm2. Toate numerele sunt măsurate, nu sunt raportate de producător.