扫码分享到微信
需要了解的三大要点:
• Meta和AMD正在携手开展全栈AI基础设施的联合开发 – 涵盖AMD Helios机架级解决方案、AMD EPYC CPU、AMD Instinct GPU、AMD Pensando网络和ROCm软件,其所有均针对Meta的AI工作负载进行了优化。
• 两家公司正在针对吉瓦级部署进行设计,共同开发集成了计算、内存、网络、功耗、散热和软件的完整AI系统,以加速大规模AI训练和推理。
• Meta正在扩大跨多代AMD产品的部署,作为第六代AMD EPYC “Venice”的主要客户,其同时还将AMD Instinct MI300X升级至MI350X,并进一步采用基于定制MI450的GPU。
AI正在改变的不仅是数据中心所承担的任务,也改变了其设计方式。在Meta,无论从训练、推理、推荐和排序、内容达到为数十亿人提供全新的AI体验,AI基础设施的需求都在飞速增长,满足这一需求不仅仅是增加GPU或服务器,它还需要以业界前所未有的速度,在整个数据中心内加强AI处理能力。
Advancing AI 2026峰会上,在Meta基础设施负责人Santosh Janardhan与AMD 董事会主席及首席执行官苏姿丰博士(Dr. Lisa Su)的对话中阐述了Meta是如何应对这一增长的新阶段,以及为什么与AMD等合作伙伴之间的深度合作正在变得日益重要。
设计吉瓦级AI基础设施
传统数据中心架构通常侧重于优化单个服务器或组件,但AI已经改变了这种模式。如今AI平台的性能取决于计算、网络、内存、功耗、散热和软件能否高效协同运作。而对于Meta这样的规模而言,这些要素无法被独立设计。
整个基础设施必须作为一个集成式AI系统设计,在吉瓦级规模下高效可靠地运行。
这种转变正在推动基础设施运营方与技术合作伙伴之间开展更深入的协作。Meta和AMD不再是在开发周期结束时选择成品组件,而是从硅芯片到软件在需求和工程决策上就保持一致。灵活性与规模同样重要:训练、推理、推荐系统以及新兴的智能体应用各自对基础设施提出不同要求。
携手AMD EPYC共同推动AI
一个开放的、异构的架构能够帮助Meta为每项工作负载匹配适当的硬件,同时在整个集群中保持高利用率。这正是 Meta 与 AMD 不断深化合作的基础:联合开发支持多样化且快速演进的 AI 工作负载组合所需的硅芯片、系统和软件。
双方的合作涵盖多个世代的 AMD EPYC处理器 - 包括 Milan、Bergamo、Turin和现在的 Venice。Meta 已在其基础设施中部署了数百万颗 EPYC CPU,并作为“Venice”的主要客户与 AMD 保持密切合作,该CPU预计将提供更多核心、更高性能、更佳能效,并在对 Meta 工作负载尤为重要的领域实现定制化。Meta 目前正在其实验室中对基于“Venice”的平台进行验证,早期结果令人鼓舞,双方团队正在为大规模部署做准备。
随着 AI 系统变得更加具备智能体特性,CPU 的角色也越来越重要。GPU 仍然是训练和推理的核心,但 CPU 在协调智能体、执行工具、运行代码、管理数据以及统筹围绕 AI 模型的更广泛系统方面承担着越来越多的职责。随着这些工作负载的增长,CPU 与 GPU 性能之间的平衡变得更加关键。Meta 计划在“Venice”的部署基础上继续推进,并与 AMD 在“Verano”以及未来的EPYC代际路线图上保持合作。
基于 Instinct GPU 共同设计 AI 基础设施
双方在 GPU 和机架级系统领域的合作也取得了显著进展。今年早些时候,Meta 通过开放计算项目(Open Compute Project)推出了 Open Rack Wide(ORW)规范,定义了一种专为 AI 规模基础设施打造的开放式机架架构。
AMD Helios 机架级解决方案基于 ORW 标准构建,将 AMD 对开放性的承诺从芯片和软件延伸至系统、机架以及大规模集群。Helios 将 AMD Instinct GPU、EPYC 处理器、AMD Pensando 网络以及 ROCm软件集成于一个经过完整工程设计的机架级平台中,旨在满足吉瓦级规模部署所需的性能、能效和可维护性需求。
这一共同的架构理念使双方能够随着每一代 Instinct 加速器的演进开展更深入的合作。双方合作始于 MI300X,该产品让双方积累了在超大规模环境中运行 AMD Instinct 的经验,同时针对基于 AMD ROCm 软件的生产工作负载进行优化。MI350 系列进一步将双方合作拓展至 AI 训练领域,包括支撑 Meta 平台的推荐和排序模型。
如今,Meta 计划部署基于定制化 Instinct MI450 的 GPU,这体现了双方合作已从产品部署进一步发展到深度端到端平台联合设计。
Meta 已获得Helios的早起使用权限,并正在对该平台进行测试。双方工程团队正围绕硬件、软件、系统集成以及面向工作负载的构建开展协同工作。
这项工作将支持 Meta 基于 AMD GPU 部署最高达 6 吉瓦基础设施的计划。在这一规模下,提前开展合作至关重要,因为有关功耗、散热、网络、内存和软件的决策无法等到最终认证阶段才进行,而必须从一开始就进行综合考虑。
共同构建下一代AI基础设施
下一代 AI 基础设施将通过把数据中心视为一个完整系统来构建,并在设计过程的更早阶段对工作负载、硅芯片、网络、系统和软件进行协同对齐。
这种合作已经在影响未来的 AMD 平台,包括 AMD Instinct MI500加速器以及下一代机架级系统。借助Meta在为数十亿用户运营基础设施方面的经验,与AMD的CPU、GPU和系统路线图相结合,双方旨在更快速、更高效地部署AI能力,并具备满足未来工作负载所需的灵活性。
AAI 2026:AMD 推出适用于前沿 AI 的 AMD Helios 机架级解决方案
2026-07-30 19:40京ICP证000080(一)-16
京公网安备11010802009845号