跳到主要内容
产品服务

ZCube|新一代智算集群组网架构

摒弃传统多层树状结构,采用完全扁平的互联架构,取消 Spine 层交换机,配合“单轨+多轨”混合接入与专属路由,为集群内 GPU 通信规划更短、负载更均衡的路径。

推理时延降低 20%~40%推理吞吐提升 10%~25%网络硬件投入减少 1/3全网 GPU 间 2 跳可达
ZCube 产品展示图

产品定位

以扁平换效率,以确定换性能

ZCube 从底层重构 AI 集群计算网,以更少的网络硬件成本、更短的转发路径和更均衡的流量组织方式,充分释放集群算效。

核心能力

  • 首创全网扁平化组网,取消 Spine 层交换机
  • “单轨+多轨”混合接入,在交换机之间均衡智算流量
  • ZCube 专属路由与配套网络控制软件
  • 结构性全局负载均衡与多用户物理隔离

核心能力架构

从多层堆叠到扁平互联

通过物理拓扑与路由策略协同设计,为智算业务构建更短、更均衡的通信路径。

双端口 ZCube 4096 卡组网拓扑

首创全网扁平化组网

彻底打破传统数据中心多层堆叠的树状架构,取消 Spine 层交换机,将全网互联结构彻底扁平化。

“单轨+多轨”混合接入

通过独特的网卡接入设计,为集群内任意两块 GPU 之间规划“有且仅有一条”的最优通信路径,从结构上提升网络负载均衡能力。

完备的 ZCube 配套软件

针对创新的底层拓扑,自研包括 ZCube 路由在内的一整套网络控制软件,实现底层硬件拓扑与上层软件路由协同。

核心软硬件

ZCube 组网架构生态

由 ZCube 交换机、智能体原生操作系统 YZOS、ZCube 控制器和配套部署工具共同构成的 ZCube 生态体系。

高效组网

交换机和光模块数量减少 1/3,GPU 间 2 跳交换机可达;支持多用户流量物理隔离,并优化 PFC 广播域。

智能负载均衡

内置 AI Agent,支持拥塞感知的自适应路由和主动路径切换,并支持基于源、目的 IP 选路等 LB 策略。

快速故障修复

实时监测设备状态、流量、微突发和端口故障;交换机与控制器协同,实现毫秒级故障自愈。

智能体原生操作系统 YZOS

支持“意图即代码”、领域 Skills 自动构建、真实物理环境验证和基于生产反馈的持续迭代。

ZCube 交换机产品图

ZCube 交换机

面向高密度智算组网的核心设备,参数以公司产品介绍资料为准。

交换容量
102.4 Tbps
包转发率
21,000 Mpps
业务接口
128 × QSFP112
典型功耗
2,432 W
整机尺寸
446 × 800 × 173.6 mm
端口速率
100G / 200G / 400G
ZCube 控制器能力示意

ZCube 控制器:让大规模组网自动化、可验证

ZCube 控制器覆盖架构设计、布线纠错、配置下发、故障监控与诊断;支持业务故障自动恢复、RoCE 智能调优、集群扩容与无感替换,以及租户级 GPU 编排,形成自动化运维、业务韧性优化和业务长效运营能力。

价值与效果

ZCube 与传统 Clos 架构对比

以采用 51.2T 交换机(128×400G 端口)构建 16K H200(网卡为 2×200G)集群为例,ZCube 从设备投入、通信路径、负载均衡、故障域和建设周期同步改善组网效率。

网络设备减少 33%

交换机数量由 384 台减少至 256 台,网络设备与故障源同步减少。

400G 模块减少 33%

400G 模块数量由 49152 个减少至 32768 个。

光纤线缆减少 25%

光纤线缆数量由 32768 根减少至 24576 根。

GPU 间 2 跳可达

全网 GPU 间只需经过 2 台交换机,通信路径更短。

结构性全局负载均衡

通过架构与路径协同减少 Hash 冲突和负载不均。

故障域更小

无 Spine 交换机故障,交换机互联链路故障仅波及部分 GPU。

多用户物理隔离

多用户流量由逻辑隔离提升为物理链路隔离。

建设周期缩短至 5~7 天

相比传统方案常规 7~12 天完成建设,业务可更早上线。

应用验证

从部署验证到生产交付

智算集群部署案例,呈现 ZCube 架构真实落地效果。

国产大模型公司千卡 NVIDIA 推理集群生产交付

大模型公司 NVIDIA 千卡推理生产集群

基于 Coding 推理服务,对比传统 ROFT 网络架构,验证 ZCube 通过扁平化组网和更均衡网络通信释放推理有效算力。

15%

GPU 平均推理吞吐提升

40.6%

首 Token 时延(TTFT)P99 降低

33%

网络硬件成本减少

查看案例
训练场国产 GPU 推理集群独立验证

训练场国产 GPU 推理集群

在国产智算生态中,对比 ZCube 与传统 Clos 架构在集合通信、训练和推理维度的表现。

14.5%

All-to-All 吞吐提升

22%–30%

TTFT P99 降低

7%–10%

推理吞吐提升

查看案例
某运营商国产 GPU 集群独立验证

运营商国产 GPU 集群

对比 ZCube 与 Clos 架构,在集合通信、模型训练和多租户端到端推理场景中验证性能收益。

119%

集合通信性能提升

20.1%

模型训练吞吐提升

11.5%

推理时延降低

查看案例
国产算力芯片公司国产 GPU 千卡集群生产交付

国产算力芯片公司千卡生产集群

国产算力千卡级集群已上线稳定运行数月,持续承载真实业务流量,并面向真实用户提供服务。

千卡规模

国产算力集群部署

数月

生产环境稳定运行

真实用户

持续提供服务

查看案例

产品服务

其他产品服务

组网、调优、运维与专业服务相互协同,共同覆盖智算网络完整生命周期。

智算调优

YCOS智算调优系统

面向大规模智算业务,对训推框架、通信库、网络配置和主机配置等关键环节进行系统化调优。

了解产品

智算运维

XOPS智算运维系统

面向智算集群的大规模训练和推理场景,打造计算、网络、存储全链路一体化运维平台,实现问题快速定位和故障高效排查。

了解产品

专业服务

全生命周期服务从规划到上线的完整交付能力

通过网络设备、算网调优和运维服务的一站式交付,保障智算集群网络稳定、通信高效、SLA 达标,助力集群快速上线。

了解产品
从网络开始

让下一座智算中心,从网络开始更高效

围绕新建集群、存量改造、性能调优或智能运维,与我们一起评估网络如何释放更多有效算力。

联系我们