A
大模型推理服务
在线 API、高并发。稳定跑 vLLM / SGLang,吞吐高,7×24 运行。
| 平台 | 双路 EPYC 9005,4U 8 GPU,CPU 直连 GPU |
| CPU | 2× EPYC 9355(32 核,高主频) |
| 内存 | 24× 48GB 或 64GB DDR5-6400 = 1.15–1.5 TB |
| 系统盘 | 2× 960GB NVMe RAID1 |
| 数据盘 | 2× 7.68TB NVMe Gen5(放模型权重) |
| 网络 | 2× 25GbE 或 100GbE(对外提供服务) |
| 电源 | 4× 2700W 冗余 |
- 推理对 CPU 核数要求不高,主频更重要,因为调度和 tokenize 大多是单线程。
- 推荐 TP=4 × 2 组,每颗 CPU 下的 4 张卡跑一个模型实例,避开跨 CPU 通信,吞吐比 TP=8 更高。
- 开启 FP8 / NVFP4 量化,多留显存给 KV cache,提高并发。