Přidatdokošíku

AI 计算服务器 | 128 GB GDDR7 | EPYC 512GB

687 捷克克朗
687 捷克克朗(不含增值税)

对于需要在本地生成逼真视频和图像的AI 工作室、广告公司和生成式 AI 开发人员而言,这是一款理想之选——无需支付云费用,不受 API 限制,也无需担心数据泄露。一台服务器即可替代数十台 Mac mini 或其他 AI 工作站,而总成本仅为后者的一小部分。

最后一件库存

最优惠的价格保证!
添加到购物车
AI 计算服务器 | 128 GB GDDR7 | EPYC 512GB
AI 计算服务器 | 128 GB GDDR7 | EPYC 512GB
687 捷克克朗
687 捷克克朗(不含增值税)

✅ 价格不含增值税 当使用我们的 托管
🎓 免费培训 适合初学者和高级用户
🛡️ 24 个月保修 在所有设备上
⚡ 加急服务 – 我们的快速维修 中心

安全卡支付

 

含增值税(21%)的价格
Kč831 899
不含增值税: 687 捷克克朗  · 发票需包含增值税号 / 增值税号 · 7天内送达
4块RTX 5090 Blackwell显卡——总计128GB GDDR7显存
老化测试 12 分钟,所有 GPU 功耗 575W — 0 个错误
预装AI技术栈(vLLM、llama.cpp、PyTorch、CUDA)
BMC远程管理IPMI 2.0——无需物理访问
准备就绪——只需连接并登录即可。
✓ 烧录通过 Blackwell sm_120 CUDA 12.8 订单号:KE21013 AMD EPYC 7643 512 GB ECC 内存
128 GB
总GPU显存
〜880 T
FP16 TFLOPS
1 631 吨/秒
LLM批次
0
烧录误差
人工智能内容生成

服务器用于生成与现实难辨真假的视频和图像

四颗 Blackwell GPU 配备 128GB GDDR7 显存,让您能够以全精度运行最大的开源扩散和视频模型——无需卸载、量化或等待。无需云端,无需 API 费用,数据不会离开您的网络。

已预装并测试
🎬

视频生成——混源视频、Wan2.1、CogVideoX

128 GB 显存支持生成高分辨率长序列,不受分块或帧分割的限制。全面支持 CUDA 12.8,适用于所有现代视频模型。

128 GB 显存
🖼️

图像生成

FLUX.1、SD3.5、稳定级联 — 全精度 FP16、批量、ControlNet、IP 适配器。

🧠

团队LLM推理

vLLM 张量并行 × 4 GPU — 1,631 线程/秒,支持 64 个并发用户。Qwen、Llama、Mistral、DeepSeek。

硬件

完整技术规格

GPU(× 4 块)
型号NVIDIA GeForce RTX 5090
建筑学布莱克威尔,sm_120
GPU上的显存32 GB GDDR7
总显存128 GB
多进程流式传输。170 SM/卡
内存带宽约 1,530 GB/s / GPU
TDP575W/GPU(4x = 2300W)
PCIe每插槽 16 个 Gen4 插槽
CPU 和系统内存
中央处理器AMD EPYC 7643
纤芯/光纤48C / 96T
最大频率3,64 GHz
L3缓存256 MiB
系统内存512 GB DDR4-2666
ECC是的(RDIMM)
DIMM8×64GB 三星
记忆通道8(设备齐全)
主板和存储
母板ASRockRack ROMED8-2T/BCM
BIOSP4.30(2026年5月20日)
NVMe SSD关键 P310 2 TB
顺序阅读7MB/秒
顺序写作6MB/秒
随机 4K IOPS467K/477K 黑白
缝2×10GbE + IPMI/BMC
遥控华擎机架 BMC 3.08
软件(预装)
OSUbuntu的LTS 24.04.4
NVIDIA驱动程序595.71.05(打开)
CUDA 驱动程序/工具包13.2 / 12.8
神经网络9.10.02
PyTorch2.9.1+cu128
法学硕士0.14.0
美洲驼.cppCUDA 构建,sm_120
Python 虚拟机/home/logic/llm-env
测量功率

这台机器的实际基准测试结果

测量日期:2026年10月7日,主机:dm2,订单号:KE21013。数值为测量值,并非制造商提供。

GPU 上的 FP16 性能(8192² 矩阵乘法)

图形处理器 0
219,1 T
图形处理器 1
221,3 T
图形处理器 2
219,4 T
图形处理器 3
218,3 T

总性能约 880 TFLOPS FP16 · 单卡性能比 RTX 4090 提升 33%

显存传输速率(GDDR7)

图形处理器 0
1,533 GB/s
图形处理器 1
1,533 GB/s
图形处理器 2
1,533 GB/s
图形处理器 3
1,533 GB/s

PCIe 主机↔GPU:27,6 / 28,3 GB/s(H2D / D2H)

vLLM · Qwen2.5-32B-Instruct AWQ · 张量并行 × 4 · 64 个并发用户

批量聚合吞吐量64 个并发用户
1 631 千克/秒
型号Qwen2.5-32B AWQ(马林内核)
32B
GPU 连接张量并行 × 4 个 GPU
✓ 全部 4

llama.cpp · Qwen2.5-14B Q4_K_M · 1 个 GPU · llama-bench

生成令牌tg128 基准测试
147 千克/秒
及时处理pp512 基准测试
8 234 千克/秒
量子化Q4_K_M,8,37 GiB
14,8B
7 074 MB /秒
阅读秒。
6 341 MB /秒
节
467ķ
4K 读取 IOPS
477ķ
4K 写入 IOPS
可靠性

满负荷运行 12 分钟预热测试——0 个错误

GPU 过热烧录——持续 720 秒 FP16 矩阵乘法 (8192×8192),所有 4 个 GPU 功耗均为 575 瓦 ✓ 通过
图形处理器 0
84℃,
575瓦 2,4GHz
0 个错误
图形处理器 1
88℃,
575瓦 2,35GHz
0 个错误
图形处理器 2
83℃,
575瓦 2,5GHz
0 个错误
图形处理器 3
80℃,
575瓦 2,5GHz
0 个错误
RTX 5090 降频阈值约为 90 °C · 最高实测温度 88 °C(GPU 1)· 无性能降频 · SM 时钟频率始终保持在 2,3–2,5 GHz · GPU + 96 个 CPU 线程联合测试也顺利通过,未出现错误 · 内核日志:无 Xid / NVRM / PCIe AER 错误
与竞争对手的比较

为什么选择我们的服务器而不是 Mac Studio M3 Ultra 512 GB?

配备 512GB/8TB 硬盘的 Mac Studio M3 Ultra 是苹果公司目前性能最强大的单机 AI 设备。然而,它的售价约为 100 万捷克克朗——这个价格足够购买我们多台服务器了。

Mac Studio M3 Ultra 512 GB / 8 TB Apple BTO · 32 核 CPU · 80 核 GPU · 仅限 macOS · 不支持 CUDA · 带宽约 819 GB/s
Mac Studio M3 Ultra
约1,000,000捷克克朗
BTO配置 512GB / 8TB
→
我们的服务器(含增值税)
831 捷克克朗
CUDA性能提升4倍,价格更低
参数Mac Studio M3 Ultra 512GB4× RTX 5090 服务器(KENTINO)
含增值税价格约1,000,000捷克克朗 更贵831 捷克克朗 优胜者
GPU加速器80 核 M3 Ultra GPU · ~40–60 TFLOPS FP16 · 仅限 Metal4块RTX 5090 Blackwell显卡 · ~880 TFLOPS FP16 × 15+ · CUDA 12.8
显存/AI内存512 GB 统一容量(CPU+GPU 共享)819 GB/s128 GB GDDR7 · 单GPU约1530 GB/s 速度提升 5 倍 + 512GB ECC 内存
LLM 速度 32B约 35–40 流量/秒 · 1 个用户1,631 流量/秒批次 × 40+ · 64 位用户
视频生成金属对 CUDA 模型不稳定CUDA · 混元视频 · 万维网2.1 · 原生支持
并发用户1–3 实际上64+(在LLM张量并行中)
人工智能生态系统macOS / Metal / MLX · 不支持 CUDALinux / CUDA · PyTorch · 微调 · 全部
遥控SSH · 无 IPMI · 重启需要物理访问IPMI 2.0 · BMC · iKVM 控制台 · 远程 BIOS
微调MPS不稳定,不推荐全CUDA LoRA QLoRA FSDP

一台 Mac Studio M3 Ultra 的价格,就能买到一台配备 CUDA 生态系统的 RTX 5090 服务器。

Mac Studio 512GB 非常适合单用户工作负载,尤其适用于在统一内存中运行大型模型的情况。但它的价格更高,运行在不支持 CUDA 的 macOS 系统上,最多只能支持 1-3 个用户,而且不支持微调。我们的服务器在批量推理方面速度更快,完全兼容 CUDA,并且可以同时支持整个团队。

FP16 性能提升约 15 倍 TFLOPS 64+ 个并发用户 完整的 CUDA 生态系统 微调、LoRa、训练 BMC 远程管理 24/7
预装软件

无需安装——即插即用。

NVIDIA 驱动程序 + CUDA
595.71.05 · CUDA 13.2 / 工具包 12.8 · cuDNN 9.10
火炬2.9.1
+cu128 · sm_120 Blackwell · NCCL 多 GPU
vLLM 0.14.0
张量并行 · AWQ marlin · 兼容 OpenAI API
llama.cpp(CUDA 构建)
sm_120 · 提交 c4ae9a8
HuggingFace 堆叠
变压器 · 加速器 · 扩散器 · 枢纽
Python 虚拟机
/home/logic/llm-env · /home/logic/models 中的模型

⚡ 交付和首次发布

  • 订单确认后7个工作日内发货
  • 带有增值税号的发票——公司可抵扣增值税
  • 立即更改系统密码和 BMC 密码
  • 将 BMC 设置为网络上的静态 IP 地址
  • 运行 API 推理之前,请先配置防火墙。
  • SSH 用户:logic(sudo)· BMC 用户:admin
  • GPU功耗可以调节:nvidia-smi -pl [瓦特]
  • KENTINO sro 技术支持 — 电子邮件 + 电话
技术说明 所有GPU均运行在PCIe Gen4 × 16插槽上——AMD EPYC 7003 / ROMED8-2T平台为Gen4(对LLM推理性能无影响)。RTX 5090不支持NVLink——多GPU通信通过PCIe P2P进行,速度约为24,3 GB/s(此类显卡的标准速度)。消费级RTX 5090不支持ECC显存(符合预期,ECC内存位于系统内存中)。基准测试于2026年7月10日进行,产品编号为KE21013,主机为dm2。所有数据均为实测数据,并非厂商官方数据。

维罗布斯

普普拉哈

Pc Praha 品牌的游戏电脑。捷克共和国和欧盟的最佳解决方案。专业游戏计算机、采矿设备和 Asici。

问题与解答 问答

问一个问题
目前为止还没有什么问题