Cijena s PDV-om (21%)
CZK831
Bez PDV-a: 687 520 CZK · račun s PDV brojem / PDV brojem · isporuka u roku od 7 dana
4× RTX 5090 Blackwell — ukupno 128 GB GDDR7 VRAM-a
Vrijeme rada 12 minuta, svi GPU-i 575 W — 0 grešaka
Unaprijed instaliran AI stog (vLLM, llama.cpp, PyTorch, CUDA)
BMC daljinsko upravljanje IPMI 2.0 — bez fizičkog pristupa
Spremno za korištenje - samo se povežite i prijavite
✓ Uspješno testiranje
Blackwell sm_120
CUDA 12.8
Narudžba br. KE21013
AMD EPYC 7643
512 GB ECC RAM-a
128 GB
Ukupna GPU VRAM memorija
0
Pogreške prilikom snimanja
Generiranje sadržaja umjetnom inteligencijom
Server za generiranje videa i slika koje se ne razlikuju od stvarnosti
128 GB GDDR7 VRAM-a na četiri Blackwell GPU-a omogućuje vam pokretanje najvećih difuzijskih i video modela otvorenog koda s punom točnošću - bez preusmjeravanja, kvantizacije ili čekanja. Nema oblaka, nema API naknada, nema podataka koji napuštaju vašu mrežu.
Unaprijed instalirano i testirano🎬
Generiranje videa — HunyuanVideo, Wan2.1, CogVideoX
128 GB VRAM-a omogućuje generiranje dugih sekvenci u visokoj rezoluciji bez ograničenja u popločavanju ili dijeljenju kadrova. Potpuna CUDA 12.8 podrška za sve moderne video modele.
128 GB VRAM-a
🖼️
Generiranje slike
FLUX.1, SD3.5, Stabilna kaskada — puna preciznost FP16, serija, ControlNet, IP-adapter.
🧠
Zaključivanje LLM-a za timove
vLLM tenzorsko-paralelni × 4 GPU — 1.631 niti/s za 64 istovremena korisnika. Qwen, Llama, Mistral, DeepSeek.
Hardver
Potpune tehničke specifikacije
Grafička kartica (× 4 komada)
ModelNVIDIA GeForce RTX 5090
arhitekturaBlackwell, sm_120
VRAM na GPU-u32 GB GDDR7
Ukupni VRAM128 GB
Višeprocesno strujanje.170 SM/kartica
Propusnost memorije~1.530 GB/s / GPU
TDP575 W/GPU (4x = 2300 W)
PCIeGen4 × 16 po utoru
CPU i sistemska memorija
CPUAMD EPYC 7643
Jezgre/Vlakna48C / 96T
Maks. frekvencija3,64 GHz
L3 predmemorija256 MiB
Sistemska RAM memorija512 GB DDR4-2666
ECCDa (RDIMM)
DIMM-ovi8× 64 GB Samsung
Memorijski kanali8 (potpuno opremljeno)
Matična ploča i pohrana
Matična pločaASRockRack ROMED8-2T/BCM
BIOSP4.30 (20. 5. 2026.)
NVMe SSD diskoviCrucial P310 2TB
Sekvencijalno čitanje7 MB / s
Sekvencijalno pisanje6 MB / s
Nasumični 4K IOPS467 K / 477 K crno/bijelo
Sašiti2× 10GbE + IPMI/BMC
Daljinsko upravljanjeASRock Rack BMC 3.08
Softver (unaprijed instaliran)
OSUbuntu LTS 24.04.4
NVIDIA upravljački program595.71.05 (otvoreno)
CUDA upravljački program/alatni komplet13.2 / 12.8
cuDNN9.10.02
PyTorch2.9.1+cu128
vLLM0.14.0
poziv.cppCUDA izrada, sm_120
Python venv/početna/logika/llm-env
Izmjerena snaga
Pravi kriteriji ovog konkretnog stroja
Izmjereno 10.07.2026. na hostu dm2, broj narudžbe KE21013. Brojke su izmjerene, a ne daje ih proizvođač.
Performanse FP16 na GPU-u (8192² matmul)
Ukupno ~880 TFLOPS FP16 · +33% po kartici u odnosu na RTX 4090
Brzina prijenosa VRAM-a (GDDR7)
PCIe host↔GPU: 27,6 / 28,3 GB/s (H2D / D2H)
vLLM · Qwen2.5-32B-Instruct AWQ · tenzorsko-paralelni × 4 · 64 istovremena korisnika
Agregirani protok serije64 istovremena korisnika
1 631 protok/s
ModelQwen2.5-32B AWQ (jezgra marlin)
32B
Veza s grafičkom karticomTenzorski paralelni × 4 GPU-a
✓ sve 4
llama.cpp · Qwen2.5-14B Q4_K_M · 1 GPU · llama-bench
Generiranje tokenatg128 referentna vrijednost
147 protok/s
Brza obradapp512 referentna vrijednost
8 234 protok/s
KvantizacijaQ4_K_M, 8,37 GiB
14,8B
6 341 MB / s
Unos odjeljka
Pouzdanost
12 minuta rada pri punom opterećenju — 0 grešaka
Trajanje GPU-a — 720 s kontinuirano FP16 matmul (8192×8192), sva 4 GPU-a na 575 W
✓ PROLAZ
GPU 0
84 ° C
575 W 2,4 GHz
0 pogrešaka
GPU 1
88 ° C
575 W 2,35 GHz
0 pogrešaka
GPU 2
83 ° C
575 W 2,5 GHz
0 pogrešaka
GPU 3
80 ° C
575 W 2,5 GHz
0 pogrešaka
Prag ograničavanja performansi RTX 5090 ≈ 90 °C · maksimalno izmjereno 88 °C (GPU 1) · bez ograničavanja performansi · SM takt 2,3–2,5 GHz cijelo vrijeme · kombinirani test GPU + 96 CPU niti također je prošao bez grešaka · zapisnik kernela: nema Xid / NVRM / PCIe AER grešaka
Usporedba s konkurencijom
Zašto naš server umjesto Mac Studio M3 Ultra 512 GB?
Mac Studio M3 Ultra u konfiguraciji od 512 GB / 8 TB je najsnažniji Appleov stroj s jednim kućištem za umjetnu inteligenciju. Međutim, košta oko 1.000.000 CZK - za tu cijenu možete kupiti više od jednog našeg servera.
Mac Studio M3 Ultra 512 GB / 8 TB
Apple BTO · 32-jezgreni CPU · 80-jezgreni GPU · samo macOS · bez CUDA-e · propusnost ~819 GB/s
Mac Studio M3 Ultra
~1.000.000 CZK
BTO konfiguracija 512 GB / 8 TB
→
Naš server (uključujući PDV)
831 899 CZK
4x više CUDA performansi, niža cijena
| Parametar | Mac Studio M3 Ultra 512GB | 4× RTX 5090 server (KENTINO) |
|---|
| Cijena s PDV-om | ~1.000.000 CZK skuplje | 831 899 CZK pobjednik |
| GPU akcelerator | 80-jezgreni M3 Ultra GPU-i · ~40–60 TFLOPS FP16 · Samo metal | 4× RTX 5090 Blackwell · ~880 TFLOPS-a FP16 × 15+ · CUDA 12.8 |
| VRAM / AI memorija | 512 GB ujedinjeno (dijeljeno CPU+GPU) 819 GB/s | 128 GB GDDR7 · ~1530 GB/s po GPU-u 5 puta brže + 512 GB ECC RAM-a |
| Brzina LLM-a 32B | ~35–40 protoka/s · 1 korisnik | 1.631 protok/s serija × 40+ · 64 korisnika |
| Generiranje videa | Metal nestabilan za CUDA modele | CUDA · HunyuanVideo · Wan2.1 · izvorna podrška |
| Istovremeni korisnici | 1–3 praktički | 64+ (u LLM tenzorskoj paralelnosti) |
| Ekosustav umjetne inteligencije | macOS / Metal / MLX · bez CUDA-e | Linux / CUDA · PyTorch · fino podešavanje · sve |
| Daljinsko upravljanje | SSH · bez IPMI-ja · fizički pristup za ponovno pokretanje | IPMI 2.0 · BMC · iKVM konzola · udaljeni BIOS |
| Fino podešavanje | MPS nestabilan · ne preporučuje se | Puni CUDA LoRA QLoRA FSDP |
Za cijenu Mac Studija M3 Ultra dobivate RTX 5090 server s CUDA ekosustavom
Mac Studio 512 GB je izvrstan za opterećenja s jednim korisnikom i ogromnim modelima u objedinjenoj memoriji. Ali je skuplji, radi na macOS-u bez CUDA-e, može podnijeti maksimalno 1-3 korisnika i ne podržava fino podešavanje. Naš poslužitelj je brži za batch inferenciju, ima potpunu CUDA kompatibilnost i može podnijeti cijeli tim odjednom.
~15x više TFLOPS-a FP16
64+ istovremenih korisnika
Potpuni CUDA ekosustav
Fino podešavanje, LoRA, obuka
BMC daljinsko upravljanje 24/7
Unaprijed instaliran softver
Nema instalacije - samo priključite i prijavite se
NVIDIA upravljački program + CUDA
595.71.05 · CUDA 13.2 / alat 12.8 · cuDNN 9.10
PyTorch 2.9.1
+cu128 · sm_120 Blackwell · NCCL višestruki GPU
vLLM 0.14.0
tenzor-paralelni · AWQ marlin · OpenAI API kompatibilan
llama.cpp (CUDA verzija)
sm_120 · commit c4ae9a8
HuggingFace stog
transformatori · ubrzanje · difuzori · glavčina
Python venv
/početna/logika/llm-env · modeli u /početna/logika/model
⚡ Isporuka i prvo lansiranje
- Dostava u roku od 7 radnih dana nakon potvrde narudžbe
- Račun s PDV brojem — PDV odbitak za tvrtke
- Odmah promijenite sistemsku lozinku i BMC lozinku
- Postavite BMC na statičku IP adresu na vašoj mreži
- Konfigurirajte vatrozid prije pokretanja API inferencije
- SSH korisnik: logic (sudo) · BMC korisnik: admin
- Potrošnja energije GPU-a može se regulirati: nvidia-smi -pl [vati]
- Tehnička podrška KENTINO sro — e-pošta + telefon
Tehničke napomene
Svi GPU-ovi rade na PCIe Gen4 × 16 — AMD EPYC 7003 / ROMED8-2T platforma je Gen4 (nema utjecaja na performanse LLM inferencije). RTX 5090 nema NVLink — komunikacija s više GPU-ova preko PCIe P2P ~24,3 GB/s (standardno za ovu klasu). ECC GPU memorija nije dostupna na potrošačkoj RTX 5090 (očekivano, ECC je na sistemskoj RAM memoriji). Mjerenja su provedena 10.7.2026., dio #KE21013, dm2 host. Sve brojke su izmjerene, a ne prijavljuje ih proizvođač.