关键词: AMD 微软Azure Helios机架系统 AI推理算力 ROCm
当地时间7月20日,AMD与微软共同宣布扩大战略合作范围,涵盖AMD的GPU、CPU、网络技术及软件生态。微软将在其Azure云平台上大规模部署AMD Helios机架级AI解决方案,用于支撑微软自身业务、AI客户及Azure AI服务的前沿模型推理任务。AMD预计将于2026年下半年开始向微软等客户交付Helios系统。

(微软宣布合作消息)
此次合作标志着微软与AMD的关系从单一芯片采购迈向全栈系统级整合。微软Azure基础设施负责人Scott Guthrie在官方博客中表示:"AI工作负载的扩张速度已超过任何单一基础设施方案所能支撑的范围,更多模型、新型智能体负载和激增的计算需求,推动整个技术栈需要更高程度的专业化。"
根据双方公告,微软将基于AMD最新硬件推出三款Azure虚拟机服务:
该系列虚拟机基于AMD Helios机架级平台,专为现代AI服务的推理、搜索和智能体负载设计。Helios是AMD首个机架级AI参考设计,单系统集成了72颗Instinct MI455X加速器、第6代EPYC "Venice"处理器、Pensando网络设备以及ROCm软件生态,旨在为大规模AI训练与推理提供一体化平台。
据Tom's Hardware报道,Helios单系统HBM4显存总容量达31.1TB,FP8稠密算力可达1.4 exaFLOPS,FP4算力达2.9 exaFLOPS。其机架内扩展带宽为260TB/s,与英伟达Vera Rubin NVL72系统持平;机架外扩展带宽通过UALink over Ethernet可达43TB/s,约为Vera Rubin的两倍。
HDv2虚拟机专为AI数据准备、搜索、强化学习和智能体协调等CPU密集型负载设计。每台虚拟机配备近500个物理核心的第6代AMD EPYC处理器、4TB内存、32TB本地NVMe存储及400Gb Azure Boost网络。微软强调,AI加速器依赖高密度、高能效的CPU算力来处理数据、协调工作负载并保持大规模流水线运转,"没有这些,训练任务就没有足够数据可供学习,智能体也没有足够容量代表客户执行任务"。
HXv2针对半导体设计和工程仿真工作负载优化,采用AMD独特的3D V-Cache技术。每台虚拟机配备176个第6代EPYC核心,时钟频率超过5GHz,每核心可寻址缓存增加50%,内存配置近2TB或4TB,并集成800Gb InfiniBand网络。新思科技(Synopsys)首席产品开发官Shankar Krishnamoorthy评论称,与微软在Azure HX系列上的合作"使客户能够可靠、高效地利用云端计算,将EDA工作负载扩展到传统基础设施限制之外"。

除计算资源外,微软还将扩大AMD Pensando数据处理器(DPU)在Azure AI后端网络基础设施及特定Azure服务中的部署,并与AMD合作优化Azure Boost技术,将虚拟化软件相关的计算任务从CPU卸载到更高效的专用芯片上,从而提升云网络性能。
微软与AMD的深化合作,对英伟达在AI基础设施领域的统治地位构成直接挑战。
Helios是AMD首款与英伟达Vera Rubin NVL72直接对标的机架级AI系统。此前AMD主要以单卡或单服务器形式销售MI300X等加速器,而Helios将GPU、CPU、网络和冷却整合为统一架构,使AMD首次能够以"系统供应商"而非单纯的"芯片供应商"身份与英伟达竞争。
AMD过去一年与OpenAI、Meta等达成了大规模AI基础设施合作,Helios机架级系统亦获得多家云厂商关注。这反映出AI厂商正主动拓宽芯片来源,降低对单一供应商的依赖。

(AMD与厂商合作消息)
微软此次部署Helios明确聚焦于"前沿模型推理"而非训练。随着AI行业从模型训练转向大规模推理部署,推理市场的性价比竞争日趋激烈。AMD在此领域取得Azure这一关键平台,意味着其有机会在英伟达最稳固的领地之外建立滩头阵地。
尽管AMD硬件规格亮眼,但英伟达的CUDA生态系统仍是其最坚固的护城河。AMD的ROCm开放平台虽在快速发展,但开发者生态成熟度与CUDA仍有差距。Windows Forum的分析指出,Helios的成功"不仅取决于发布或首批出货,更取决于微软能否反复部署、保持加速器高利用率、提供有竞争力的定价,并让开发者获得不逊于英伟达的体验"。
据机构估算,英伟达在AI训练市场占据80%以上份额(不同机构估算在86%-92%之间),AMD为个位数至低双位数。微软扩大与AMD合作,短期内更可能是"补充"而非"替代"英伟达。Azure将继续同时运营英伟达和AMD基础设施,为客户提供多元化选择。
对微软而言,引入AMD Helios有助于缓解Azure AI服务的算力瓶颈。随着Kimi K3等开源大模型引发推理需求激增,以及微软自身Copilot等AI产品的快速扩张,Azure需要更多元、更具成本效益的算力来源。
微软将Helios用于Azure AI服务及Microsoft Foundry托管计算,意味着企业客户和AI实验室未来可通过Azure直接获取基于AMD的推理能力,而无需自行采购和部署硬件。这不仅降低了AI应用的门槛,也为微软在与亚马逊AWS、谷歌云的竞争中增加了差异化筹码。
来源:电子工程专辑