国产大模型公司千卡 NVIDIA 推理集群生产交付
大模型公司 NVIDIA 千卡推理生产集群
基于 Coding 推理服务,对比传统 ROFT 网络架构,验证 ZCube 通过扁平化组网和更均衡网络通信释放推理有效算力。
15%
GPU 平均推理吞吐提升
40.6%
首 Token 时延(TTFT)P99 降低
33%
网络硬件成本减少
对比 ZCube 与 Clos 架构,在集合通信、模型训练和多租户端到端推理场景中验证性能收益。
项目信息
项目环境、业务场景和验证方式。
背景与挑战
运营商场景需要在国产 GPU 集群中同时承载多租户业务,并兼顾集合通信、模型训练吞吐与端到端推理时延。
验证结果
以下指标均以无轨道优化的 Clos 架构为对比基线,仅适用于本案例所述国产 GPU 与多租户测试环境。
119%
集合通信性能提升
相比无轨道优化的 Clos 架构方案。
20.1%
模型训练吞吐提升
国产 GPU 模型训练场景的对比结果。
11.5%
推理时延降低
多租户端到端推理场景的时延改善。
33%
资本支出减少
扁平化架构减少网络硬件投入。
价值总结
在多租户推理场景下,ZCube 相比无轨道优化的 Clos 架构方案展现出明显性能优势。
客户案例
查看更多 ZCube 在不同算力环境、业务场景与项目阶段中的验证和生产实践。
基于 Coding 推理服务,对比传统 ROFT 网络架构,验证 ZCube 通过扁平化组网和更均衡网络通信释放推理有效算力。
15%
GPU 平均推理吞吐提升
40.6%
首 Token 时延(TTFT)P99 降低
33%
网络硬件成本减少
在国产智算生态中,对比 ZCube 与传统 Clos 架构在集合通信、训练和推理维度的表现。
14.5%
All-to-All 吞吐提升
22%–30%
TTFT P99 降低
7%–10%
推理吞吐提升
国产算力千卡级集群已上线稳定运行数月,持续承载真实业务流量,并面向真实用户提供服务。
千卡规模
国产算力集群部署
数月
生产环境稳定运行
真实用户
持续提供服务
围绕新建集群、存量改造、性能调优或智能运维,与我们一起评估网络如何释放更多有效算力。