昇腾900

访问官网

Atlas900AI集群是华为推出的面向AI计算中心的重算力训练集群,由数千颗昇腾训练处理器构成,整合HCCS、PCIe和RoCE高速互联,用于图像、语音、自然语言等大规模AI模型训练。

分类: AI开发与模型模型与训练 #模型训练 #模型与训练 #基础设施 #计算集群 #AI训练集群 #昇腾处理器

产品概述

Atlas 900 AI集群是华为昇腾计算产品线中的旗舰级训练基础设施。该集群采用数千颗昇腾训练处理器组成大规模并行计算系统,主要部署于人工智能计算中心和超大规模AI训练场景。面向当前AI模型参数量持续增长的趋势,Atlas 900提供了一种全栈国产化的重算力解决方案。

硬件架构

Atlas 900的核心算力来源于昇腾系列AI训练处理器。集群通过三种高速互联技术实现处理器间的高效协同:HCCS(华为缓存一致性系统)提供处理器间的高速直连通道,PCIe负责节点内的数据通路,RoCE(RDMA over Converged Ethernet)实现跨节点的低延迟网络通信。华为的集群通信库和作业调度平台对这三级互联进行统一管理,目的是在全集群范围内充分释放昇腾处理器的计算性能。

应用场景

Atlas 900主要面向三类场景。AI模型训练:支撑图像识别、语音识别、自然语言处理等领域的超大规模模型训练任务。科研探索:为高校和科研机构提供开展前沿AI研究所需的算力基础。自动驾驶:加速自动驾驶算法模型的训练与迭代,支撑从感知到决策的全链路AI模型开发。这些场景的共同特点是算力需求巨大,普通单机或中小集群难以在合理时间内完成训练任务。

产业定位

Atlas 900是华为昇腾AI计算生态的组成部分,向上对接ModelArts等AI开发平台,向下整合昇腾处理器和集群网络等硬件基础设施。华为昇腾产品系列还包括Atlas 800推理服务器、Atlas 500智能小站等,覆盖从边缘到云端的多种部署形态。Atlas 900作为系列中的算力旗舰,代表华为在AI训练基础设施领域的技术布局。

选型参考

Atlas 900面向的典型用户是AI计算中心、大型企业和科研机构。产品的具体配置方案(处理器数量、内存容量、存储规格等)、部署环境要求和商务流程需通过华为企业业务渠道咨询。生态兼容性方面,华为昇腾平台已适配PyTorch、TensorFlow等主流框架,但具体模型迁移和性能优化的实际情况因场景而异。

继续探索 AI 工具

从同类、热门或新收录工具里快速找下一站。

返回工具列表