Precio con IVA (21%)
CZK831 899
Sin IVA: 687 520 CZK · Factura con número de IVA · Entrega en 7 días
4× RTX 5090 Blackwell — 128 GB de VRAM GDDR7 en total
Prueba de rodaje de 12 minutos, todas las GPU de 575 W: 0 errores.
Paquete de IA preinstalado (vLLM, llama.cpp, PyTorch, CUDA)
Gestión remota de BMC IPMI 2.0: sin acceso físico
Listo para empezar: solo conéctate e inicia sesión.
✓ PASE de rodaje
Blackwell sm_120
CUDA 12.8
Pedido n.° KE21013
AMD EPYC 7643
512 GB de RAM ECC
128 GB
VRAM total de la GPU
Generación de contenido mediante IA
Servidor para generar vídeos e imágenes indistinguibles de la realidad.
Los 128 GB de VRAM GDDR7 distribuidos en cuatro GPU Blackwell permiten ejecutar los modelos de difusión y vídeo de código abierto más exigentes con total precisión, sin descarga de procesamiento, cuantización ni tiempos de espera. Sin nube, sin costes de API, sin que los datos salgan de tu red.
Preinstalado y probado🎬
Generación de vídeo: HunyuanVideo, Wan2.1, CogVideoX
Los 128 GB de VRAM permiten generar secuencias largas en alta resolución sin limitaciones de división de fotogramas ni de segmentación. Compatibilidad total con CUDA 12.8 para todos los modelos de vídeo modernos.
128 GB de VRAM
🖼️
Generación de imágenes
FLUX.1, SD3.5, Cascada estable: FP16 de precisión completa, procesamiento por lotes, ControlNet, adaptador IP.
🧠
Inferencia LLM para equipos
vLLM tensor-parallel × 4 GPU: 1631 hilos/s para 64 usuarios concurrentes. Qwen, Llama, Mistral, DeepSeek.
Componentes metálicos
Especificaciones técnicas completas
GPU (× 4 unidades)
ModeloNVIDIA GeForce RTX 5090
La arquitecturaBlackwell, sm_120
VRAM en la GPU32 GB GDDR7
VRAM total128 GB
Transmisión multiproceso.170 SM/tarjeta
Ancho de banda de la memoria~1530 GB/s / GPU
TDP575 W/GPU (4x = 2300 W)
PCIeGen4 × 16 por ranura
CPU y memoria del sistema
CPUAMD EPYC 7643
Núcleos/Fibras48C / 96T
Frecuencia máxima3,64 GHz
Caché L3256 MiB
Memoria RAM del sistemaGB-512 4 DDR2666
ECCSí (RDIMM)
DIMM8 discos duros Samsung de 64 GB
Canales de memoria8 (totalmente equipado)
Placa base y almacenamiento
tarjeta madreASRockRack ROMED8-2T/BCM
BIOSP4.30 (20.5.2026)
NVMe SSDCrucial P310 2TB
lectura secuencial7 MB / s
escritura secuencial6 MB / s
IOPS aleatorias de 4K467 K / 477 K blanco y negro
Coser2× 10GbE + IPMI/BMC
Control remotoASRock Rack BMC 3.08
Software (preinstalado)
OSUbuntu LTS 24.04.4
controlador de NVIDIA595.71.05 (abierto)
Controlador/kit de herramientas CUDA13.2 / 12.8
cuDNN9.10.02
PyTorch2.9.1+cu128
vllm0.14.0
llama.cppCompilación CUDA, sm_120
python venv/home/logic/llm-env
Potencia medida
Pruebas de rendimiento reales de esta máquina en particular.
Medido el 10/7/2026 en el host dm2, pedido n.° KE21013. Los valores son mediciones realizadas, no proporcionados por el fabricante.
Rendimiento FP16 en GPU (8192² matmul)
Total ~880 TFLOPS FP16 · +33% por tarjeta en comparación con la RTX 4090
Velocidad de transferencia de VRAM (GDDR7)
Host PCIe↔GPU: 27,6 / 28,3 GB/s (H2D / D2H)
vLLM · Qwen2.5-32B-Instruct AWQ · tensor-parallel × 4 · 64 usuarios concurrentes
Rendimiento agregado por lotes64 usuarios simultáneos
1 631 tok/s
ModeloQwen2.5-32B AWQ (núcleo de marlín)
32B
conexión de GPUParalelismo tensorial × 4 GPU
✓ los 4
llama.cpp · Qwen2.5-14B Q4_K_M · 1 GPU · llama-bench
Generación de tokensReferencia tg128
147 tok/s
Procesamiento rápidopp512 punto de referencia
8 234 tok/s
CuantizaciónQ4_K_M, 8,37 GiB
14,8B
6 341 MB / s
Entrada de sección
477 K
IOPS de escritura de 4K
Fiabilidad
Prueba de funcionamiento de 12 minutos a plena carga: 0 errores
Prueba de estrés de la GPU: 720 s de multiplicación de matrices FP16 sostenida (8192×8192), las 4 GPU a 575 W.
✓ PASE
GPU0
84 ° C
575 W 2,4 GHz
0 errores
GPU1
88 ° C
575 W 2,35 GHz
0 errores
GPU2
83 ° C
575 W 2,5 GHz
0 errores
GPU3
80 ° C
575 W 2,5 GHz
0 errores
Umbral de limitación de rendimiento RTX 5090 ≈ 90 °C · máximo medido 88 °C (GPU 1) · sin limitación de rendimiento · frecuencia SM de 2,3–2,5 GHz en todo momento · la prueba combinada de GPU + 96 hilos de CPU también se superó sin errores · registro del kernel: sin errores Xid / NVRM / PCIe AER
Comparación con la competencia.
¿Por qué nuestro servidor en lugar del Mac Studio M3 Ultra de 512 GB?
El Mac Studio M3 Ultra en la configuración de 512 GB/8 TB es el ordenador de Apple más potente para IA en un solo equipo. Sin embargo, cuesta alrededor de 1.000.000 CZK; por ese precio podrías comprar más de uno de nuestros servidores.
Mac Studio M3 Ultra 512 GB / 8 TB
Apple BTO · CPU de 32 núcleos · GPU de 80 núcleos · Solo macOS · Sin CUDA · Ancho de banda de ~819 GB/s
Mac Estudio M3 Ultra
~1.000.000 CZK
Configuración BTO 512 GB / 8 TB
→
Nuestro servidor (IVA incluido)
831 899 CZK
Rendimiento CUDA 4 veces superior, precio más bajo.
| parámetro | Mac Studio M3 Ultra 512 GB | Servidor 4× RTX 5090 (KENTINO) |
|---|
| Precio con IVA | ~1.000.000 CZK más caro | 831 899 CZK ganador |
| acelerador de GPU | GPU M3 Ultra de 80 núcleos · ~40–60 TFLOPS FP16 · Solo en formato Metal | 4× RTX 5090 Blackwell · ~880 TFLOPS FP16 × 15+ · CUDA 12.8 |
| Memoria VRAM/AI | 512 GB unificados (CPU+GPU compartida) 819 GB/s | 128 GB GDDR7 · ~1530 GB/s por GPU 5 veces más rápido + 512 GB de RAM ECC |
| Velocidad LLM 32B | ~35–40 flujos/s · 1 usuario | Lote de 1631 flujos/s × 40+ · 64 usuarios |
| Generación de vídeo | Metal inestable para modelos CUDA | CUDA · HunyuanVideo · Wan2.1 · Soporte nativo |
| Usuarios simultáneos | 1–3 prácticamente | 64+ (en paralelo tensorial LLM) |
| ecosistema de IA | macOS / Metal / MLX · sin CUDA | Linux / CUDA · PyTorch · ajuste fino · todo |
| Control remoto | SSH · sin IPMI · acceso físico para reiniciar | IPMI 2.0 · BMC · Consola iKVM · BIOS remota |
| Sintonia FINA | MPS inestable · no recomendado | CUDA LoRA QLoRA FSDP completo |
Por el precio de un Mac Studio M3 Ultra, obtienes un servidor RTX 5090 con el ecosistema CUDA.
El Mac Studio de 512 GB es ideal para cargas de trabajo de un solo usuario con modelos enormes en memoria unificada. Sin embargo, es más caro, funciona con macOS sin CUDA, admite un máximo de 1 a 3 usuarios y no permite el ajuste fino. Nuestro servidor es más rápido para la inferencia por lotes, es totalmente compatible con CUDA y puede gestionar a todo el equipo simultáneamente.
~15 veces más TFLOPS FP16
Más de 64 usuarios simultáneos
Ecosistema CUDA completo
Ajuste fino, LoRA, formación
Gestión remota de BMC 24/7
Software preinstalado
No requiere instalación: solo conéctalo e inicia sesión.
Controlador NVIDIA + CUDA
595.71.05 · CUDA 13.2 / kit de herramientas 12.8 · cuDNN 9.10
PyTorch 2.9.1
+cu128 · sm_120 Blackwell · NCCL multi-GPU
vLLM 0.14.0
tensor paralelo · AWQ marlin · Compatible con API OpenAI
llama.cpp (compilación CUDA)
sm_120 · commit c4ae9a8
pila HuggingFace
transformadores · acelerar · difusores · centro
python venv
/home/logic/llm-env · modelos en /home/logic/models
⚡ Entrega y primer lanzamiento
- Entrega en un plazo de 7 días laborables tras la confirmación del pedido.
- Factura con número de IVA: IVA deducible para empresas.
- Cambie la contraseña del sistema y la contraseña de BMC inmediatamente.
- Configure el BMC con una IP estática en su red.
- Configure el firewall antes de ejecutar la inferencia de la API.
- Usuario SSH: logic (sudo) · Usuario BMC: admin
- El consumo de energía de la GPU se puede regular: nvidia-smi -pl [watts]
- Soporte técnico KENTINO sro — correo electrónico + teléfono
Notas técnicas
Todas las GPU funcionan en PCIe Gen4 × 16: la plataforma AMD EPYC 7003 / ROMED8-2T es Gen4 (sin impacto en el rendimiento de la inferencia LLM). La RTX 5090 no tiene NVLink: comunicación multi-GPU a través de PCIe P2P ~24,3 GB/s (estándar para esta clase). La memoria ECC de la GPU no está disponible en la RTX 5090 para consumidores (como se esperaba, ya que la ECC está en la RAM del sistema). Pruebas de rendimiento medidas el 10/7/2026, número de pieza KE21013, host dm2. Todos los valores son medidos, no reportados por el fabricante.