Preço com IVA (21%)
Kč831 899
Sem IVA: 687 520 CZK • Fatura com número de IVA / Número de IVA • Entrega em até 7 dias
4× RTX 5090 Blackwell — 128 GB de VRAM GDDR7 no total
Teste de estresse de 12 minutos, todas as GPUs a 575 W — 0 erros
Conjunto de ferramentas de IA pré-instalado (vLLM, llama.cpp, PyTorch, CUDA)
Gerenciamento remoto BMC IPMI 2.0 — sem acesso físico
Pronto para começar? Basta conectar e fazer login.
✓ Teste de ativação aprovado
Blackwell sm_120
CUDA12.8
Pedido nº KE21013
AMD EPYC 7643
512 GB de RAM ECC
1 631 t/s
turma de mestrado em direito (LLM)
geração de conteúdo por IA
Servidor para gerar vídeos e imagens indistinguíveis da realidade.
128 GB de VRAM GDDR7 distribuídos em quatro GPUs Blackwell permitem executar os maiores modelos de difusão e vídeo de código aberto com precisão total — sem descarregamento, quantização ou espera. Sem nuvem, sem taxas de API, sem dados saindo da sua rede.
Pré-instalado e testado🎬
Geração de vídeo — HunyuanVideo, Wan2.1, CogVideoX
128 GB de VRAM permitem a geração de longas sequências em alta resolução sem limitações de mosaico ou divisão de quadros. Suporte completo ao CUDA 12.8 para todos os modelos de vídeo modernos.
128 GB VRAM
🖼️
Geração de imagens
FLUX.1, SD3.5, Cascata Estável — FP16 de precisão total, em lote, ControlNet, Adaptador IP.
🧠
Inferência LLM para Equipes
vLLM tensor-parallel × 4 GPU — 1.631 threads/s para 64 usuários simultâneos. Qwen, Llama, Mistral, DeepSeek.
Hardware
Especificações técnicas completas
GPU (4 unidades)
ModeloNVIDIA GeForce RTX 5090
arquiteturaBlackwell, sm_120
VRAM na GPU32 GB GDDR7
VRAM total128 GB
Transmissão multiprocesso.170 SM/cartão
Largura de banda da memória~1.530 GB/s / GPU
TDP575W/GPU (4x = 2300W)
PCIeGen4 × 16 por slot
CPU e memória do sistema
CPUAMD EPYC 7643
Núcleos/Fibras48C / 96T
Frequência máxima3,64 GHz
cache de L3256 MiB
RAM do sistemaGB-512 4 DDR2666
ECCSim (RDIMM)
DIMMs8× 64GB Samsung
Canais de memória8 (totalmente equipado)
Placa-mãe e armazenamento
placa-mãeASRockRack ROMED8-2T/BCM
BIOSP4.30 (20. 5. 2026)
SSD NVMeCrucial P310 2TB
Leitura sequencial7 074 MB / s
Escrita sequencial6 341 MB / s
IOPS aleatórios em 4K467 K / 477 K preto/branco
Costurar2× 10GbE + IPMI/BMC
Gestão remotaASRock Rack BMC 3.08
Software (pré-instalado)
OSUbuntu LTS 24.04.4
Driver NVIDIA595.71.05 (aberto)
Driver/kit de ferramentas CUDA13.2 / 12.8
cuDNN9.10.02
PyTorch2.9.1+cu128
vLLM0.14.0
lhama.cppCompilação CUDA, sm_120
Ambiente Python/home/logic/llm-env
Potência medida
Testes de desempenho reais desta máquina específica
Medido em 10/7/2026 no host dm2, pedido nº KE21013. Os valores foram medidos e não fornecidos pelo fabricante.
Desempenho FP16 na GPU (8192² matmul)
Total de aproximadamente 880 TFLOPS FP16 · +33% por placa em comparação com a RTX 4090
Taxa de transferência de VRAM (GDDR7)
PCIe host↔GPU: 27,6 / 28,3 GB/s (H2D / D2H)
vLLM · Qwen2.5-32B-Instruct AWQ · tensor-parallel × 4 · 64 usuários simultâneos
rendimento agregado em lote64 usuários simultâneos
1 631 tok/s
ModeloQwen2.5-32B AWQ (kernel marlin)
32B
Conexão da GPUTensor-paralelo × 4 GPUs
✓ todos os 4
llama.cpp · Qwen2.5-14B Q4_K_M · 1 GPU · llama-bench
Geração de tokensbenchmark tg128
147 tok/s
Processamento rápidopp512 benchmark
8 234 tok/s
QuantizaçãoQ4_K_M, 8,37 GiB
14,8B
6 341 MB / s
Entrada secundária
Confiabilidade
Teste de rodagem de 12 minutos em carga máxima — 0 erros
Teste de estresse em GPUs — 720 s de multiplicação de matriz FP16 sustentada (8192×8192), todas as 4 GPUs a 575 W
✓ PASS
GPU0
84 ° C
575 W 2,4 GHz
0 erros
GPU1
88 ° C
575 W 2,35 GHz
0 erros
GPU2
83 ° C
575 W 2,5 GHz
0 erros
GPU3
80 ° C
575 W 2,5 GHz
0 erros
Limiar de throttling da RTX 5090 ≈ 90 °C · temperatura máxima medida de 88 °C (GPU 1) · sem throttling de desempenho · clock do SM de 2,3 a 2,5 GHz o tempo todo · teste combinado de GPU + 96 threads de CPU também aprovado sem erros · log do kernel: sem erros de Xid / NVRM / PCIe AER
Comparação com a concorrência
Por que nosso servidor em vez do Mac Studio M3 Ultra de 512 GB?
O Mac Studio M3 Ultra na configuração de 512 GB/8 TB é a máquina Apple mais poderosa para IA em um único dispositivo. No entanto, ele custa cerca de 1.000.000 CZK — por esse preço, você pode comprar mais de um dos nossos servidores.
Mac Studio M3 Ultra 512 GB / 8 TB
Apple BTO · CPU de 32 núcleos · GPU de 80 núcleos · Exclusivo para macOS · Sem CUDA · Largura de banda de ~819 GB/s
Mac Estúdio M3 Ultra
~1.000.000 CZK
Configuração BTO 512GB / 8TB
→
Nosso servidor (IVA incluído)
831 899 CZK
Desempenho CUDA 4 vezes superior, preço mais baixo.
| Parâmetro | Mac Studio M3 Ultra 512GB | Servidor com 4 placas RTX 5090 (KENTINO) |
|---|
| Preço com IVA | ~1.000.000 CZK mais caro | 831 899 CZK ganhador |
| acelerador de GPU | GPUs M3 Ultra de 80 núcleos · ~40–60 TFLOPS FP16 · Somente Metal | 4× RTX 5090 Blackwell · ~880 TFLOPS FP16 × 15+ · CUDA 12.8 |
| Memória VRAM / IA | 512 GB unificados (CPU + GPU compartilhados) 819 GB/s | 128 GB GDDR7 · ~1530 GB/s por GPU 5 vezes mais rápido + 512 GB de RAM ECC |
| Velocidade LLM 32B | Fluxo de aproximadamente 35 a 40 litros/s · 1 usuário | 1.631 fluxo/s lote × 40+ · 64 usuários |
| Geração de vídeo | Metal instável para modelos CUDA | CUDA · HunyuanVideo · Wan2.1 · suporte nativo |
| Usuários simultâneos | 1–3 praticamente | 64+ (em paralelo tensorial LLM) |
| ecossistema de IA | macOS / Metal / MLX · sem CUDA | Linux / CUDA · PyTorch · ajuste fino · todos |
| Gestão remota | SSH · sem IPMI · acesso físico para reinicialização | IPMI 2.0 · BMC · Console iKVM · BIOS remota |
| Afinação | MPS instável · não recomendado | CUDA completo LoRA QLoRA FSDP |
Pelo preço de um Mac Studio M3 Ultra, você leva para casa um servidor com RTX 5090 e o ecossistema CUDA.
O Mac Studio de 512 GB é ótimo para cargas de trabalho de usuário único com modelos grandes em memória unificada. Mas é mais caro, roda em macOS sem CUDA, suporta no máximo de 1 a 3 usuários e não oferece suporte a ajuste fino. Nosso servidor é mais rápido para inferência em lote, tem total compatibilidade com CUDA e pode lidar com toda a equipe simultaneamente.
Aproximadamente 15 vezes mais TFLOPS FP16
Mais de 64 usuários simultâneos
Ecossistema CUDA completo
Ajuste fino, LoRa, treinamento
Gerenciamento remoto BMC 24 horas por dia, 7 dias por semana.
Software pré-instalado
Sem instalação — basta conectar e fazer login.
Driver NVIDIA + CUDA
595.71.05 · CUDA 13.2 / toolkit 12.8 · cuDNN 9.10
PyTorch 2.9.1
+cu128 · sm_120 Blackwell · NCCL multi-GPU
vLLM 0.14.0
tensor-paralelo · AWQ marlin · Compatível com OpenAI API
llama.cpp (compilação CUDA)
sm_120 · commit c4ae9a8
Pilha HuggingFace
transformadores · acelerar · difusores · cubo
Ambiente Python
/home/logic/llm-env · modelos em /home/logic/models
⚡ Entrega e primeiro lançamento
- Entrega em até 7 dias úteis após a confirmação do pedido.
- Fatura com número de IVA — IVA dedutível para empresas
- Altere imediatamente a senha do sistema e a senha do BMC.
- Configure o BMC para um endereço IP estático na sua rede.
- Configure o firewall antes de executar a inferência de API.
- Usuário SSH: logic (sudo) · Usuário BMC: admin
- O consumo de energia da GPU pode ser regulado: nvidia-smi -pl [watts]
- Suporte técnico KENTINO sro — e-mail + telefone
Notas técnicas
Todas as GPUs operam em PCIe Gen4 × 16 — a plataforma AMD EPYC 7003 / ROMED8-2T é Gen4 (sem impacto no desempenho de inferência LLM). A RTX 5090 não possui NVLink — comunicação multi-GPU via PCIe P2P de aproximadamente 24,3 GB/s (padrão para esta classe). Memória ECC na GPU não está disponível na RTX 5090 para o consumidor (esperado, já que o ECC está presente na RAM do sistema). Benchmarks medidos em 10/7/2026, peça nº KE21013, host dm2. Todos os valores foram medidos, não relatados pelo fabricante.