行业资讯

加入亿拓客·流量大师 撬动财富之门!!!

研报解读:《新一代AIDC怎么定义》

wang 2026-10-08 行业资讯
研报解读:《新一代AIDC怎么定义》

新一代AIDC怎么定义?六维指标给出答案

全球计算联盟(GCC)× 中国电子院 × 国投 联合编制 | 2026年9月

过去判断一个数据中心先进不先进,看的是用了什么服务器、什么交换机、PUE做到多少。但当单机柜功率冲到百千瓦、单集群规模冲向十万卡乃至百万卡,这套「看设备选型」的老办法已经彻底失灵了。

全球计算联盟(Global Computing Consortium)联合中国电子院、国投编制的这份报告,给出了一套解法:用六维指标体系给AIDC(AI数据中心)划代,让基础设施第一次有了可量化、可横向对比的统一标尺。

报告同时给出最佳实践参考——3D数据中心架构。以下是全篇要点的系统梳理。

一、为什么必须重新定义AIDC

1. 三个物理量级同时跳变

· 单柜功率:从传统的千瓦级别,跃升到100—300千瓦甚至更高的百千瓦级别,对建筑供电、散热、结构承载能力提出前所未有的要求。

· 集群规模:从万卡级别迅速向十万卡乃至百万卡的超大规模演进,高密度算力部署成为行业常态。

· 交付节奏:传统依赖现场勘测、施工、调试的线性建设模式,正被预制化、产品化模式取代,交付周期从以年为单位压缩到以月甚至周为单位。

这三个变化叠加,彻底改变了数据中心的物理形态和基础设施设计理念。

2. 运维与能效的评价维度也在扩张

· 运维:从人工巡检、被动排查,转向AI驱动的全流程自动化——故障预警、自动定位、闭环自愈。

· 能效:除了对PUE提出更严苛要求,还引入WUE(水利用效率)、CUE(碳利用效率),对水资源消耗和绿电占比提出更高标准。

3. 评估对象从「单点」变成「系统」

传统IDC侧重服务器、交换机等单点设备的性能指标;AIDC是一个高度耦合的复杂系统,更强调从单个机柜、整栋楼宇到整个算力集群的端到端整体系统能力。

对比维度

传统 IDC

AIDC

硬件特征

机柜功率较低(通常10—20kW),密度较低,集群规模较小(万卡级)

机柜功率大幅提升(百千瓦级),建筑承载密度显著提高,集群规模向十万卡、百万卡演进

建设模式

传统现场施工为主,建设周期长,升级改造相对复杂

预制化、产品化转型,算力交付周期大幅压缩,支持硬件快速迭代改造

运维模式

依赖人工被动排查和处置故障

系统自动闭环自愈,智能化程度高

能效要求

主要关注PUE指标,要求相对宽松

对PUE、水资源利用、绿电占比等指标要求更为严苛

评估标准

侧重单点设备性能和基础指标

强调从机柜、楼宇到集群的整体系统能力,需要全新的量化评估标准

表1 传统IDC与AIDC的差异(来源:全球计算联盟,2026)

4. 借鉴通信行业的划代范式

技术行业早有成熟先例:移动通信靠速率、时延、连接数区分3G、4G、5G;PCIe每一代以带宽、传输速率为判据;WiFi靠吞吐、时延、并发接入能力界定WiFi4/5/6。它们的共同点是——代际升级不以单一设备改动为标志,而是整套系统能力的跨越。

反观AIDC,如果仅凭产品型号、建筑外观或企业概念去定义「新一代」,必然造成概念混淆。产业需要一套面向全行业、可量化、可横向对比的指标体系。

二、六维指标体系:两个空间 × 四个生命周期

报告建议以单个算力集群作为基础评价单元,围绕「机柜—集群」两大空间尺度,叠加「建设—改造—运行—能耗」四大生命周期尺度,搭建六维指标体系。

维度

观察尺度

指标名称

指标单位

单柜功率

机柜

标准机柜功率

kW / MW

集群规模

集群

单集群算力规模

卡

交付速度

建设周期

机电交付周期

月

弹性兼容

改造周期

代际改造周期

月

运维方式

故障闭环

关键故障闭环时间

小时 / 分钟 / 秒

综合能效

综合能效

电能利用效率(PUE)

无量纲

表2 新一代AIDC六维指标体系(来源:全球计算联盟,2026)

其中,机柜和集群两个空间维度聚焦算力承载能力,回答的核心问题是:一套算力集群究竟能承载多大规模的AI算力。建设、改造、运行、能耗四个生命周期维度,则聚焦工程落地与运营表现。

三、六维指标逐条拆解

维度一 · 单柜功率(kW/MW)

定义:标准机柜内IT设备的最大功率。这是判定数据中心是否跨入「超密液冷」下一代AIDC的分水岭指标。

· 当前以通用云计算为主流的数据中心,机柜平均运行密度仍集中在 6~12 kW/柜;而智算场景下GPU/NPU集群单柜功耗已快速突破 40—80 kW/柜(参考NVIDIA DGX SuperPOD、ODCC液冷集群参考架构)。

· 传统风冷+列头柜的末端配电与散热体系,在物理极限上已无法无损承载——架构矛盾从「局部优化空间不足」转为「系统性不可行」。

怎么算才公平:不同厂商机柜宽度、深度及专属Sidecar配置存在差异,直接比「单柜多少千瓦」容易失真。报告建议以600mm宽标准柜位归一化,并披露机柜深度;专门服务于该机柜的Sidecar、配电柜或制冷单元,计入实际占用空间。

指标

计算公式

标准柜位功率

= IT额定连续功率 ×(实际占用宽度 ÷ 600mm)

计量核心:标准机柜(47U,600×1200mm基准)内IT设备的最大功率

未来:单柜功率是否必然达到MW级,仍取决于芯片功率、超节点形态、供电路线、散热能力和互连技术,但向百kW级持续演进的方向明确。

维度二 · 集群规模(卡)

定义:可以并发运行单一大模型同步训练的物理AI加速卡总数。

把它列为核心指标,逻辑在于——智算时代,数据中心的物理边界影响了集群的最优通信边界。

· 传统模式:先有机房空间 → 再往里部署机柜 → 最后跑业务,算力规模是入驻后的结果。

· 下一代模式:先定义跑多大规模的集群 → 再反向倒推建筑、供电、制冷和网络平面如何建设。

换句话说,数据中心不再是算力的「容器」,而是集群的「物理载体」;机房设计不仅要考虑面积,还要考虑单栋内需要的最大紧耦合算力规模。

指标

计算公式

单集群算力规模

= 模型算力需求 × 训练样本数 ÷ 训练时间 ÷ 单卡算力 ÷ 算力利用率

未来单集群算力规模向百万卡级演进,需要电、冷、网、算像一台机器一样协同起来,形成最优的集群系统工程设计。

维度三 · 交付速度(月)

定义:在单个算力集群边界内,从机电系统深化设计启动或设备采购启动,到完成综合调试验收、具备IT设备安全上电条件的日历周期。

· AI算力需求突发性强、窗口期短,大模型训练集群往往要求数月内完成部署。

· 传统数据中心机电交付周期普遍为 12~18个月,依赖现场大量交叉作业和顺序施工,难以匹配GPU/NPU每 1~2年一代的硬件迭代节奏。

· 预制化、模块化、产品化把大量现场工作量前移至工厂,机电交付周期可压缩至 6个月以内,部分全预制解决方案甚至实现 3个月级交付。

指标

计算公式

机电交付周期

= 机电系统具备上电条件日期 − 机电深化设计启动日期(或设备采购合同生效日,以先发生者为准)

口径说明:适用范围包含为某一算力集群专属服务的中低压供配电系统、UPS、末端配电与智能母线、制冷系统(含液冷一次侧、二次侧分配)、弱电与自控系统、消防系统等;不包括土建结构施工、IT设备安装调试及业务软件部署。

为什么起点取「先发生者」:确保不遗漏任何制约交付的关键路径——无论是设计驱动的预制化建设,还是提前锁定长周期设备的采购行为。终点统一为「具备上电条件」而非IT加电运行,是为了排除业务部署阶段的影响。

维度四 · 弹性兼容(月)

定义:从正式确定算力代际升级改造需求开始,到完成硬件更换、系统联调并实现业务可承载运行的全流程日历周期。

· 传统数据中心受定制化设计约束,机电系统与初代硬件深度绑定,改造周期普遍长达 6~12个月甚至更久,且难以在线实施。

· 面向新一代AIDC,通过模块化设计、容量预留、标准化接口和预制化改造单元,改造周期压缩至 3个月以内,部分仅更换IT硬件的场景可缩短至 数周。

改造周期越短,代表基础设施对未来算力代际更迭的弹性兼容能力越强,是衡量其长期投资价值和代际先进性的关键维度。

改造场景

覆盖范围

仅更换IT硬件

不涉及供配电、制冷、机柜结构等机电改动,仅完成新硬件安装、线缆连接与系统联调

涉及机电系统改动

包括供配电容量调整、UPS及末端配电改造、制冷系统升级(如风冷改冷板液冷、液冷二次侧扩容)、机柜承重与结构改造、布线调整、自控逻辑更新

指标

计算公式

代际改造周期

= 业务可承载运行日期 − 改造需求确定日期

并行实施的以整体完成联调日期为终点,串行实施的以最后完成部分为终点;所有场景均需注明业务停机时长。

维度五 · 运维方式

定义:关键故障闭环时间——关键系统故障从产生到隔离或恢复的完整周期,由故障发现、故障定界、应急处置三个阶段构成。

为什么传统运维撑不住了?两个方面同时恶化:

· 规模侧:大规模集群部署下监测点位数量突破百万级,供电、制冷与IT之间耦合更紧,人工监控逐步变得不可行。

· 时间侧:算力机柜高密度增长,设备异常处置的时间窗口被快速压缩,部分异常已无法依靠人员现场应急处置。

子阶段

定义

诊断价值

指标单位

T_故障发现

从异常信号出现到系统识别并确认故障的时间

反映系统故障感知能力

秒级

T_故障定界

从确认故障到确定根因及具体故障点的时间

反映系统跨域因果分析能力

分钟级

T_应急处置

从确定根因到完成隔离或业务恢复的时间

反映系统自动控制与执行能力

分钟级~小时级

表3 故障阶段分类和诊断指标(来源:全球计算联盟,2026)。三个子阶段需分别记录并单独披露。

配套披露两个指标:

· 风险发现能力:当系统先于故障产生就识别风险,故障发现时间可能为负或故障根本不会发生——需单独披露,客观评价预测性运维能力。

· 自动闭环率:统计周期内无需人工干预即可完成全流程故障处置的比例。需注意,自动闭环率不可能达到100%,始终存在需要物理介入的故障类型,合理期望是逐步提升而非追求绝对值。

统计口径上,应按「供电故障」「制冷故障」「IT故障」「跨域多点故障」四类分别统计分布范围,而非只给一个平均值。

维度六 · 综合能效(PUE)

定义:数据中心消耗的所有能源与IT负载消耗的能源之比。报告要求用三类PUE联合评价,覆盖从设计承诺、工程交付到长期运行的全生命周期。

PUE类型

定义

设计PUE

在特定室外气象条件、IT负载率及冗余配置下,设计阶段的预期电能利用效率

实测PUE

在指定气候区和负载条件下,验收或专项测试阶段实测得到的电能利用效率

年度实测PUE

按自然年统计的实际总输入电能与IT设备实际消耗电能的比值

指标

计算公式

PUE

= 数据中心总输入电能 ÷ IT设备消耗电能

统计边界:从市电进线计量点开始,含中低压变配电、UPS、末端配电、制冷系统、照明、安防、消防、自控,直至IT设备电源输入端口。IT设备自身能耗为分母,不包含在分子中。年度实测PUE取全年累计比值,而非各月算术平均。

PUE不能覆盖全部能源价值。报告建议把WUE(水资源利用效率)、CUE(碳利用效率)、绿电比例以及储能削峰填谷带来的用电成本优化,作为扩展指标单独披露,形成电—水—碳多维度协同评价。

四、AIDC划代:三档量级对照

根据六项指标定义,报告把AIDC划分为传统IDC、新一代AIDC、AIDC未来方向三档。

维度

指标名称

传统IDC

新一代AIDC

AIDC未来方向

单柜功率

标准机柜功率

十kW级

百kW级

MW级

集群规模

单集群算力规模

万卡级

十万卡级

百万卡级

交付速度

机电交付周期

6~9个月

3~5个月

1~2个月

弹性兼容

代际改造周期

月级

星期级

天级

运维方式

关键故障闭环时间

被动响应

主动预防

自动闭环

综合能效

电能利用效率(PUE)

≥1.3

<1.2

<1.1

表4 新一代AIDC六维指标代际量级(来源:全球计算联盟,2026)。报告注明:所列代际数值均用于表达能力量级,不构成未经产业验证的强制阈值。

补充口径:报告正文对交付速度的行业现状描述为「传统12~18个月 → 预制化压缩至6个月以内、部分全预制3个月级」,与表4的量级参考口径不同,引用时需注意区分。

五、最佳实践:3D数据中心如何落地

3D数据中心围绕「标准重构、分层解耦、立体堆叠」三大理念,实现IT系统与基础设施系统的物理解耦和能力独立演进。通过电力、冷量及空间资源池化,实现算力资源跨模块动态配置。

其根本动因是:传统数据中心基础设施具有较强刚性,而AI算力发展呈现高动态性和不确定性。未来数据中心需要从「固定容量承载模式」转向「资源池化、动态调度、弹性演进」的新型架构。

1. 资源池化与弹性调度:支撑AI多代次演进

· 供电池化:以 12MW产品化POD 为基础标准模块,沿垂直方向部署 3MW大容量智能母线,构建统一电力资源池。突破传统机柜级供电物理边界,支持高功率密度AI超节点与低功率存储、网络设备的混合部署。

· 弹性调度:依托负载历史数据预测负载功率,比对预测曲线与实际负载,识别超负荷风险与闲置区域,在业务零中断前提下重构电力分配路径。

· 制冷池化:构建「水力模块+冷源」的源侧池化,实现风液同源、冷量全局动态调配。丰水区域选开式冷却塔,缺水区域选干冷器或闭式冷却塔;集群间及超节点间以CDU模块化扩容实现冷量调度。

· 高密度液冷与低密度风冷机柜可在同一POD内混合部署,由液冷二次管路侧智能控制精准供冷。

2. 分层解耦与架构极简:支撑高密算力部署

3D数据中心把AIDC划分为「制冷、IT、供电、冷源和备电」四个独立功能层,把AI算力部署在独立层空间,最大限度缩短集群间互联距离。

链路

极简设计

带来的能力

供电链路

垂直智能母线直通机柜顶部,配电层级由3级精简至2级

标准单机柜供电能力由 40kW 提升至 300kW;具备平滑演进至800V直流供电及固态变压器(SST)的能力

制冷链路

减少一级换热环节,换热层级由3级精简至2级;制冷设备独立层空间

整体换热能效提升,可平滑过渡至全液冷架构

3. 产品化工厂预制:从「工程现场制作」到「产品化交付」

核心理念是「产品化+数字化」,把复杂的数据中心系统拆解为可复制单元,实现从交付「建筑空间」向交付「可量化算力单元」的跨越。

· 设计制造一体化:以「乐高式」解耦思维,将AIDC划分为静态底座与动态算力,从源头规避设计风险。

· 质量验证标准化:关键电力、水力模块前移至工厂完成预制、测试和验证,通过 1:1样板试装 验证可交付性与可运维性。

· POD交付产品化:实施「三层并进、垂直互连」并行施工,配合「白盒化」逻辑测试与自动化交付流水线,实现网络配置、服务器压测及转维上线零人工干预。

4. Agentic智能运维:从被动响应到自主决策

智能运维沿「告警监控 → 分析预测 → 智能自主决策」三阶段演进。针对AI高密集群故障扩散快、应急窗口时间短的特点,构建「韧性优先、确定性交付、智能体自治」三位一体体系。

· 全链路数字化映射:以IoT数据流实现 百万级检测信号秒级上报,覆盖供电、散热参数与工质液的生物、化学特性,实现从微米级微通道到宏观建筑园区的全范围映射。

· 制冷侧预测:打通冷却塔至芯片的全液冷链路数字化建模,构建从芯片到冷源的全链路温度与功耗模型,在线监测工质液pH值、电导率,预测微生物滋生、防范设备腐蚀。

· 供电侧预测:构建从市电到服务器电源的 毫秒级 全链路监控与预警。

· 提前发现液冷管路泄漏、工质液劣化脏堵、电池失效及母线接触不良等风险隐患。

· 运维管理Agent:可远程完成故障定位定界、变更推演与作业风险拦截;应急场景下关键部件自主响应,实现供电制冷系统自愈。

5. 六维指标在3D数据中心上的落点

· 单柜功率:实现AI多代次兼容及「零改造」下的单柜 100kW~300kW 高密度部署。

· 集群规模:IT独立层单层即可支撑 万卡至十万卡 规模的算力集群。

· 交付速度:土建开工到整体交付 10个月,POD单元主设备到场后 3个月 交付。

· 综合能效:通过优化L1基础设施与L2算力网络系统能效,结合供电制冷架构优化与智能化全域寻优,实现 PUE降至1.15以下。

六、四点产业倡议

报告强调,六维指标体系的价值不是提前给所有技术路线下结论,而是建立一套全产业可以共同讨论、测量和比较的语言。

· 共同完善指标定义:联合算力厂商、数据中心客户、设计院、科研机构和基础设施企业,进一步明确六项指标的测试边界、分级值和评价方法。

· 共同建设参考架构:围绕3D数据中心等代表性架构,推动供电、制冷、IT、储能和智能运维接口标准化,支持多代次、多厂商和多技术路线。

· 共同开展标杆验证:选择具有代表性的AIDC项目,对功率、密度、规模、交付、运维和能效进行测量,用真实工程数据持续校正指标体系。

· 共同推进标准与认证:在指标体系和标杆验证基础上,逐步形成参考设计、团体标准、评价认证与产业推广机制。

一分钟速览

· 老办法失灵:单柜功率冲到百千瓦、集群冲向百万卡,「看设备选型」已无法衡量AIDC的综合能力。

· 六维指标体系:单柜功率、集群规模、交付速度、弹性兼容、运维方式、综合能效——两大空间尺度叠加四大生命周期尺度。

· 单柜功率是分水岭:通用云 6~12kW/柜 vs 智算 40—80kW/柜;每跨一个数量级,配电、散热、承重走线全部要重构。

· 集群规模倒推设计:传统「先有房再部署」,下一代「先定集群再倒推建筑、供电、制冷、网络」。

· 交付速度:传统机电 12~18个月 → 预制化压缩至6个月以内、部分3个月级;表4给出 6~9 / 3~5 / 1~2个月 三档量级。

· 弹性兼容:改造周期从 6~12个月 压到 3个月以内,仅换IT硬件可缩至数周,目标是支撑多代硬件「零改造」兼容。

· 运维量化到三段:故障发现(秒级)、故障定界(分钟级)、应急处置(分钟级~小时级);自动闭环率不可能100%。

· 能效看三类PUE:设计、实测、年度实测;100MW负载下PUE从1.35降到1.25,年省电约8,700万kWh。

· 3D数据中心落点:单柜100—300kW、单层万卡至十万卡、整体交付10个月、POD 3个月、PUE降至1.15以下。

数据来源:全球计算联盟(Global Computing Consortium)× 中国电子院 × 国投《新一代AIDC定义与实践研究报告》(2026年9月)。本文为公开报告解读与要点梳理,文中代际数值仅代表能力量级。不构成任何投资建议。

猜你喜欢

发表评论

发表评论: