2小时前
来源:极客公园
2026 人工智能计算大会(AICC2026)上,浪潮信息发布元脑HC2000多元算力机组。元脑 HC2000 是采用 DirectCom 2.0 极速架构,基于高密液冷 AI 整机柜、搭配 MCIS 推理软件栈,实现计算负载按需匹配、动态优化的多元算力 AI 服务器机组。同等投资Token产能提升10倍,为容量型智算扩产。

随着大模型与 Agent 的发展,AI 正在从「回答问题」走向「解决问题」,智能也逐步成为可以规模化生产和供给的资源。浪潮信息认为,Agent 时代的 AI 计算要以 Capability AI Compute 能力型智算不断突破智能上限,以 Capacity AI Compute 容量型智算推动智能规模化供给。元脑 HC2000 是面向容量型智算需求的多元算力机组,以开放汇聚多元,以协同实现全局最优,让每一份计算资源产生更多的智能。
Agent规模化应用,对智能供给提出更高要求
生产足够多、足够便宜的智能并不容易。复杂 Agent 任务包含持续推理、工具调用、结果反馈和重新规划,需要计算系统持续提供推理服务。随着任务规模扩大、上下文持续增长,系统需要在满足服务水平要求的同时,提高资源利用效率,让算力投入转化为更多 Token 产出。因此,Capacity 的扩展不能只是增加算力,更要让不同算力与不同负载精准匹配,让每一份计算资源产生更多的智能。
重新认识负载:AI 推理不是一种单一的计算负载,把「大模型推理」真正拆开就会发现,不同计算负载有不同的计算特征。Prefill 具有高并行、高计算密度的特点;Decode 是逐 Token 串行执行,更依赖内存带宽;Attention 需要频繁访问不断增长的 KV Cache;MoE 包含稀疏计算和大规模 All-to-All 通信。不同计算阶段、不同模型模块,有着独特的计算和数据特征。
重新配置算力:不同负载还会随着上下文长度、输出长度和并发规模动态变化,系统瓶颈可能在计算、显存容量、带宽和网络通信之间不断转移。这意味着,只用同一种芯片和同一种服务器形态,并不是最高效的算力组织方式。需要按照不同的计算负载重新配置算力,不再要求一种芯片什么都做,而是让不同算力承担最适合自己的负载。
重新组织系统:简单增加更多的服务器,不仅无法带来线性的容量增长,还可能因为资源配比失衡、跨节点通信和任务排队,使部分算力长期闲置,另一部分资源持续拥塞。因此,需要通过统一软件栈,把不同芯片、推理阶段、存储层级组织成高效协同的整体。
元脑HC2000,同等投资Token产能提升10倍
面向智能规模化供给需求,浪潮信息发布元脑 HC2000 多元算力机组。元脑 HC2000 是采用 DirectCom 2.0 极速架构,基于高密液冷 AI 整机柜、搭配 MCIS 推理软件栈,实现计算负载按需匹配、动态优化的多元算力 AI 服务器机组。同等投资 Token 产能提升 10 倍。
高密液冷AI整机柜。元脑 HC2000 的核心组件是高密液冷 AI 整机柜,采用全液冷设计和高通流供电,突破传统风冷机柜的散热与供电瓶颈,单柜最大承载 256 张 AIPU,算力密度实现 4 倍跃升,并支持标准开放加速模组,适配多元本土算力芯片。同时,DirectCom 2.0 极速架构让通信能力与算力密度同步扩展,实现计算与通信 1∶1 均衡配比,柜内聚合带宽可达 200Tbps,支持跨柜多平面无损扩展。

多元算力承载。在高密部署和算网均衡的基础上,元脑 HC2000 进一步将不同算力与计算负载精准匹配。在 Prefill 阶段,可选择大算力芯片搭配 LPDDR 颗粒,匹配高并行、计算密集的特点,并兼顾配置成本。在 Decode 阶段,可选择具有大容量 HBM 的 AI 芯片,兼顾显存容量和带宽;针对计算稀疏、IO 敏感的 FFN 环节,可选择 3D DRAM 堆叠芯片,缩短数据搬运路径、提高访存带宽。通过这样的分工,让多元芯片充分发挥各自的能力优势,再通过软件栈组织起来,共同完成推理任务,提升整个机组的 Token 产出效率。

为充分释放元脑 HC2000 的性能,浪潮信息打造了「MCIS多元算力协同推理软件栈」,覆盖请求路由、P/D 分离推理、算力动态调整和 KV Cache 管理等关键环节。MCIS 支持多元算力的 P/D 分离计算框架,兼容主流本土 AI 芯片及 SGLang、vLLM 等推理框架,让不同类型的算力能够灵活组合、协同计算。

Prefill与Decode算力动态调整。面向多元算力「选型难、部署难、定位难、优化难」的问题,MCIS 构建了「测量、分配、监控、调整」的优化闭环。部署前,通过性能仿真评估不同芯片、并行方式和 P/D 组合,找到更合适的配置方案;方案确定后,根据现有资源自动完成资源分配、环境配置和 P/D 实例部署。系统上线后,通过贯通请求、计算、缓存和传输的全链路监控,及时识别性能瓶颈及实际运行与模型预测之间的偏差。当业务负载发生变化时,重新评估并调整 P/D 配比、实例数量和负载分配,再通过实际运行验证调整效果,将部署前的方案设计与部署后的运行优化贯通起来。

支持多元算力的KV Cache管理框架。算力规模越大,KV Cache 流动的效率就越重要。MCIS 打通不同类型算力之间的点对点数据直传,避免 CPU 中转和重复拷贝,小数据量传输性能最高提升约 5 倍。同时,根据 KV Cache 数据的冷热程度构建分级存储体系,结合其数据结构特点,通过多级流水、并行聚合等技术优化,在相关多盘测试中,将节点内本地磁盘 IO 性能提升约 32 倍。通过突破 KV Cache 的存储与传输瓶颈,让数据更高效地流动,将多元算力的潜能转化为大模型推理的实际效能。

同时,浪潮信息面向能力型智算需求发布元脑 SD200 Ultra 超节点 AI 服务器。元脑 SD200 Ultra 基于本土 AI 芯片,单机承载运行 2.8 万亿参数的 Kimi K3 大模型,Token生成时延首次突破5.85毫秒。元脑 SD200 Ultra 以开放系统设计紧耦合 128 芯本土 AI 芯片,实现统一内存寻址超低延迟通信,支持 10 万亿参数规模前沿模型,打造面向 Agent 时代的能力型智算标杆。
从「提供算力」走向「生产智能」,计算系统需要在拓展智能能力边界的同时,持续提高智能供给效率。浪潮信息将围绕模型和 Agent 的实际需求,通过全栈规划与跨层协同推进贯穿式系统创新,以开放的系统架构汇聚多元算力,让高水平智能以可负担的成本进入更多企业和行业应用。
来源:互联网
声明:此文版权归原作者所有,若有来源错误或者侵犯您的合法权益,您可通过邮箱与我们取得联系,我们将及时进行处理。邮箱地址:zhaobozhi@jnexpert.com
推荐
我要评论