Server voor het genereren van video's en afbeeldingen die niet van de werkelijkheid te onderscheiden zijn.
Met 128 GB GDDR7 VRAM verdeeld over vier Blackwell GPU's kunt u de grootste open-source diffusie- en videomodellen met volledige nauwkeurigheid uitvoeren, zonder offloading, kwantisering of wachttijden. Geen cloud, geen API-kosten, geen data die uw netwerk verlaat.
Videogeneratie — HunyuanVideo, Wan2.1, CogVideoX
128 GB VRAM maakt het mogelijk om lange sequenties in hoge resolutie te genereren zonder beperkingen door tiling of frame-splitting. Volledige CUDA 12.8-ondersteuning voor alle moderne videomodellen.
Beeldgeneratie
FLUX.1, SD3.5, Stable Cascade — volledige precisie FP16, batch, ControlNet, IP-adapter.
LLM-inferentie voor teams
vLLM tensor-parallel × 4 GPU — 1.631 threads/s voor 64 gelijktijdige gebruikers. Qwen, Llama, Mistral, DeepSeek.
Volledige technische specificaties
Echte benchmarks van deze specifieke machine
Gemeten op 10-7-2026 op host dm2, ordernummer KE21013. De waarden zijn gemeten en niet door de fabrikant opgegeven.
FP16-prestaties op GPU (8192² matmul)
Totaal ~880 TFLOPS FP16 · +33% per kaart ten opzichte van de RTX 4090
VRAM-overdrachtssnelheid (GDDR7)
PCIe host↔GPU: 27,6 / 28,3 GB/s (H2D / D2H)
vLLM · Qwen2.5-32B-Instruct AWQ · tensor-parallel × 4 · 64 gelijktijdige gebruikers
llama.cpp · Qwen2.5-14B Q4_K_M · 1 GPU · llama-bench
12 minuten inbranden onder volledige belasting — 0 fouten
Waarom onze server in plaats van de Mac Studio M3 Ultra 512 GB?
De Mac Studio M3 Ultra in de configuratie met 512 GB / 8 TB is de krachtigste Apple-machine in één behuizing voor AI. Hij kost echter zo'n 1.000.000 Tsjechische kronen – voor dat bedrag kunt u meer dan één van onze servers kopen.
| parameter | Mac Studio M3 Ultra 512GB | 4× RTX 5090 Server (KENTINO) |
|---|---|---|
| Prijs inclusief btw | ~1.000.000 CZK duurder | 831 899 CZK winnaar |
| GPU-versneller | 80-core M3 Ultra GPU's · ~40–60 TFLOPS FP16 · Alleen Metal | 4× RTX 5090 Blackwell · ~880 TFLOPS FP16 × 15+ · CUDA 12.8 |
| VRAM / AI-geheugen | 512 GB gecombineerd (CPU+GPU gedeeld) 819 GB/s | 128 GB GDDR7 · ~1530 GB/s per GPU 5x sneller + 512 GB ECC RAM |
| LLM snelheid 32B | ~35–40 debieten/s · 1 gebruiker | 1.631 stromen/s batch × 40+ · 64 gebruikers |
| Videogeneratie | Metaal is instabiel voor CUDA-modellen. | CUDA · HunyuanVideo · Wan2.1 · native ondersteuning |
| Gelijktijdige gebruikers | 1–3 praktisch | 64+ (in LLM tensor parallel) |
| AI-ecosysteem | macOS / Metal / MLX · zonder CUDA | Linux / CUDA · PyTorch · finetuning · alles |
| Beheer op afstand | SSH · geen IPMI · fysieke toegang voor herstart | IPMI 2.0 · BMC · iKVM-console · BIOS op afstand |
| Scherpstellen | MPS instabiel · niet aanbevolen | Volledige CUDA LoRA QLoRA FSDP |
Voor de prijs van een Mac Studio M3 Ultra krijg je een RTX 5090-server met het CUDA-ecosysteem.
De Mac Studio 512 GB is geweldig voor workloads van één gebruiker met enorme modellen in een uniform geheugen. Maar hij is duurder, draait op macOS zonder CUDA, kan maximaal 1-3 gebruikers aan en biedt geen ondersteuning voor fine-tuning. Onze server is sneller voor batch-inferentie, is volledig CUDA-compatibel en kan het hele team tegelijk aan.
Geen installatie nodig — gewoon aansluiten en inloggen.
⚡ Levering en eerste lancering
- Levering binnen 7 werkdagen na orderbevestiging.
- Factuur met btw-nummer — btw aftrekbaar voor bedrijven
- Wijzig onmiddellijk het systeemwachtwoord en het BMC-wachtwoord.
- Stel het BMC-adres in op een statisch IP-adres in uw netwerk.
- Configureer de firewall voordat u API-inferentie uitvoert.
- SSH-gebruiker: logic (sudo) · BMC-gebruiker: admin
- Het stroomverbruik van de GPU kan worden geregeld: nvidia-smi -pl [watt]
- Technische ondersteuning KENTINO sro — e-mail + telefoon









