AI服务器 · AI数据中心 · 液冷 · 云计算

鼎天国际基础设施与全球AI数据中心

鼎天国际基础设施围绕AI服务器、AI数据中心、液冷、电力、高速网络和云计算展开。核心方法是把"买到GPU"和"能用上GPU"当作两件事分开看待——供电、散热、网络和厂房建设,任何一环滞后,都会让已经到货的算力长期无法真正投入使用。

数据电力和算力作为输入经过AI Factory持续产出Token和推理结果的输入输出关系示意图
Concepts

先把概念说清楚

AI Infrastructure是什么?

支撑AI计算的完整基础设施,包括加速器、内存、网络、存储、电力、冷却和厂房设施,而不仅仅是采购GPU这一件事。

AI Factory是什么?

围绕Training、Inference和Agentic AI持续组织算力、电力和数据资源的数据中心运行模式,区别于运行大量不同IT业务的传统数据中心。

AI服务器和普通服务器有什么区别?

AI服务器针对大规模并行计算优化,通常搭载多颗加速器、高速互连和更强的散热设计,功率密度远高于传统通用服务器。

AI数据中心为什么耗电?

大规模GPU集群持续高负载运行,加上供电、冷却和网络设备的能耗,使AI数据中心的功率需求远高于传统数据中心。

为什么AI数据中心需要液冷?

单机架功率密度持续上升后,依赖大风量空调的传统风冷方案效率和空间成本都会遇到明显瓶颈,液冷能更高效地带走集中热量。

液冷是什么?

用液体而非空气把芯片产生的热量带走的散热方式,常见形式包括冷板式液冷,需要配合CDU和设施水路循环使用。

为什么数据中心需要高速网络?

大规模训练依赖成百上千颗GPU协同计算,网络带宽和延迟不足会导致GPU之间互相等待,拖慢整体训练效率。

Scale-up和Scale-out是什么?

Scale-up指同一服务器内GPU之间的高带宽互连,Scale-out指跨服务器、跨机柜的网络扩展,两者共同决定集群整体吞吐。

光互连为什么重要?

在长距离和高带宽场景下,光互连比传统铜互连更具优势,但不会全面替代铜互连,而是根据距离和带宽需求分场景共存。

AI Cloud是什么?

面向大模型训练和推理需求专门优化的云计算服务形态,建立在传统云基础设施之上,强调算力调度和大规模并行效率。

Sovereign Cloud是什么?

关注数据主权、司法管辖和运营控制等维度的云计算模式,不同国家的定义和要求并不相同,服务器物理位置只是其中一部分。

供电与网络

鼎天国际基础设施:一万个GPU已经到货以后,为什么供电和网络可能让其中一部分长时间无法发挥性能?

一万个GPU全部到货、全部安装上架,看起来是一个大型AI集群建设过程中最难的一步已经完成。但在很多实际项目里,芯片到货之后才是另一场硬仗的开始:供电容量是否真的够用、网络拓扑是否真的合理,这两个问题如果没处理好,相当一部分已经安装完成的算力,会长期处于闲置或者远低于设计吞吐的状态。

供电容量不是简单的加法

一个机架能装多少颗GPU,理论上只取决于物理空间,但实际能装多少,取决于这个机架能拿到多少稳定的供电容量。很多数据中心项目在规划初期按照较低的功率密度设计配电系统,等到后续引入更高功率的新一代GPU时才发现,原有的配电容量根本无法支撑同样物理空间内更高的功率需求——要么被迫降低单机架的装机密度,要么需要对配电系统进行改造,两种方案都会拖慢原计划的部署节奏。供电容量的规划需要预留出未来两三代硬件的功率增长空间,而不是仅仅满足当前这一批芯片的需求,这也是很多项目容易低估的一个环节。

电力从区域电网经过变电站配电系统最终到达机架和GPU负载的AI数据中心供电链路示意图

网络拓扑决定芯片之间怎样"说话"

大规模训练任务依赖成百上千颗GPU协同工作,单颗GPU的算力再强,如果和其他GPU交换数据的速度跟不上,训练过程中就会出现大量等待,实际吞吐远低于芯片理论算力的总和。这里涉及两层网络设计:Scale-up,即同一服务器内多颗GPU之间的高带宽互连,决定了单节点内部协同的效率;Scale-out,即跨服务器、跨机柜的网络扩展,决定了整个集群能扩展到多大规模而不出现明显的性能衰减。如果网络拓扑设计不合理——比如带宽不足、跳数过多、或者没有针对训练任务常见的通信模式做优化——即便每台服务器内部性能优异,集群整体的有效算力仍然会大打折扣。

AI集群内部GPU节点通过交换网络与存储节点管理节点和跨机柜互连协同工作的网络拓扑示意图

如何判断算力是否被真正用起来

评估一个大规模GPU集群的实际表现,不能只看装机数量,更需要关注端到端的训练吞吐、集群利用率和故障恢复效率这几个系统级指标。一个常见的现象是:单卡基准测试成绩优异,但放到几千卡规模的集群里跑真实训练任务时,整体吞吐却远低于预期——这种落差往往就是供电波动、网络瓶颈或调度效率不足共同造成的。对于正在规划或运营大规模AI基础设施的团队而言,比起持续追加GPU采购数量,排查并解决供电和网络层面的瓶颈,往往能在短期内带来更明显的整体算力提升。

存储同样容易被忽略

供电和网络之外,存储系统的吞吐能力也常常被低估。大规模训练任务在读取训练数据集、保存模型检查点(Checkpoint)时,对存储系统的并发读写能力有很高要求;如果存储带宽跟不上,GPU集群会在数据加载或检查点保存阶段出现明显的空闲等待,尤其是在训练大规模模型、检查点体积达到数百GB甚至更大时,这种等待造成的算力浪费同样不可忽视。一套完整的AI基础设施评估,需要把计算、内存、网络和存储放在同一个框架里通盘考虑,而不是把注意力全部集中在GPU这一个环节上。

项目落地中常见的几个误区

不少团队在规划大规模GPU集群时,容易把预算和精力过度集中在芯片采购环节,把供电、网络和存储当作"配套工作"放在次要位置,等到芯片陆续到货后才发现配套设施的建设周期和采购周期需要单独排期,进而导致算力交付延后。更稳妥的做法是在项目启动阶段,就把芯片采购、供电工程、网络建设和存储部署作为并行的关键路径共同管理,任何一条路径的延迟都应当被视为影响整体交付时间的风险因素,而不是事后才发现的意外。

GPU可以先运到仓库等待安装,但供电容量和网络拓扑一旦在规划阶段出现偏差,往往需要额外的工程改造周期才能弥补,这也是为什么基础设施规划需要在芯片采购决策之前就同步进行,而不是等芯片到货后再补救。

文中涉及的具体功率密度、网络带宽等数据,均为行业通用参考范围,实际数值应以具体项目的工程设计资料为准。

机架与液冷

数据中心机架功率越来越高以后,为什么传统机房设计不能只靠"换更大的空调"继续升级?

过去几年,单机架的功率密度经历了持续快速的上升,很多新一代AI机架的功率需求已经逼近甚至超过传统风冷设计的合理上限。面对这种变化,一种直觉的应对思路是"换一台更大的空调",但这个思路在功率密度上升到一定阈值后,会遇到明显的边际效益递减问题。

风冷的物理极限

风冷依赖空气把芯片产生的热量带走,而空气的导热能力和比热容相对有限。功率密度越高,需要的风量就越大,风机噪音、能耗和所需的机房空间也随之上升;到某个密度区间之后,继续增大风量带来的散热收益会明显放缓,而付出的能耗和空间成本却在持续攀升,整体经济性变得不划算。更实际的问题是,很多在用机房的空间和承重设计,本身就不支持无限扩大空调设备的规模,物理空间成了硬约束。

液冷需要重新设计的不只是散热部件

液冷通过在芯片上加装冷板,用液体直接把热量带走,再经过CDU(冷却液分配单元)与设施水路循环,最终在室外完成散热排放。这条路径涉及的改动远不止"给服务器加一个水冷头":机房需要重新规划管路走向、预留接口位置、部署泄漏监控系统,运维团队需要建立新的巡检和应急处理流程,供电系统也需要为CDU等新增设备预留容量。换句话说,从风冷切换到液冷,是一次涉及机架布局、管路工程、监控系统和运维流程的整体机房重新设计,而不是单纯更换一种散热部件。

AI服务器芯片热源经过冷板CDU冷却液分配单元设施水路循环最终通过散热塔完成热量排出的液冷流程示意图

风冷与液冷的适用边界

适合中低功率密度机架;依赖机房级大风量空调系统;改造成本相对较低,对既有机房的适配性更好;散热效率随功率密度上升明显下降。

适合高功率密度机架;依赖冷板、CDU和设施水路系统;需要重新设计机房管路和运维流程,初始建设成本更高;散热效率在高密度场景下更稳定。

不能简单说液冷一定更环保

液冷经常被贴上"更节能环保"的标签,但这个结论不宜一概而论。液冷系统本身涉及水资源管理、冷却液的定期维护更换,以及初始建设阶段更高的资本投入,实际的能源和环境收益,需要结合具体气候条件、当地水资源状况、余热是否能被有效回收利用,以及整体设施设计来综合判断。在气候干燥或水资源紧张的地区,液冷系统对水的依赖可能需要额外的工程方案来平衡,这也是数据中心选址和设计阶段需要纳入考量的现实因素。

液冷的运维要求和风冷完全不同

切换到液冷之后,日常运维的关注点也会随之改变。巡检人员需要定期检查管路密封性、监控冷却液的纯度和化学稳定性、留意CDU的运行状态和报警信息;一旦出现泄漏风险,处理流程也和传统空调故障完全不同,需要提前制定应急预案并对运维团队进行专门培训。部分企业在从风冷切换到液冷的过程中,会低估这部分组织和流程层面的调整成本,把液冷简单当作一次设备采购决策,而忽略了背后需要同步建立的运维体系。

混合冷却是现实中常见的过渡方案

并不是所有机架都需要立即切换到全液冷。不少数据中心运营商采用的是混合冷却策略:对功率密度最高的AI训练机架采用液冷,对功率密度相对较低的存储、网络设备机架继续保留风冷,通过这种分区设计,在控制改造成本的同时,优先解决最紧迫的散热瓶颈。这种渐进式的过渡路径,也让运维团队有机会在较小范围内积累液冷系统的运维经验,再逐步扩大液冷覆盖范围,是当前不少新建和改造项目中较为现实的选择。

文中涉及的机架功率密度和散热方案对比,基于行业公开技术资料整理,具体项目的最优方案需结合实际气候条件、场地条件和成本预算综合评估。

Sovereign Cloud

Sovereign Cloud越来越热以后,为什么"服务器放在本国"仍然只是数字主权问题的一部分?

近两年,Sovereign Cloud(主权云)在全球范围内的讨论热度明显上升,越来越多国家和地区开始重新审视自己在关键数据和AI基础设施上的控制权。一种简化的理解是"把服务器放在本国境内就是主权云",但这个理解只覆盖了数字主权问题里最容易被看到的一个维度,忽略了其余同样重要的部分。

数据主权涉及四个维度,而不只是物理位置

更完整地理解Sovereign Cloud,至少需要看四个维度:数据主权(Data Sovereignty),即数据的存放地点和跨境流动规则;基础设施(Infrastructure),即支撑服务运行的算力、网络和存储资源是否位于本地并由本地实体运营;司法管辖(Jurisdiction),即这些数据和系统实际适用哪个国家或地区的法律,尤其是在跨国云服务商运营本地数据中心的情况下,母公司所在地的法律仍然可能对数据产生影响;运营控制(Operational Control),即谁能实际操作、访问和管理这套系统,包括紧急情况下的运维权限和访问审计能力。服务器的物理位置只回答了基础设施这一个维度的部分问题,其余三个维度同样需要被单独评估。

主权云关注数据主权基础设施司法管辖和运营控制四个维度的结构示意图

不同国家的定义和要求并不相同

值得特别注意的是,Sovereign Cloud并不存在一个全球统一的标准定义。不同国家和地区基于自身的法律体系、监管重点和产业政策,对主权云提出的具体要求存在明显差异——有的更强调数据不出境,有的更强调关键系统的运营主体必须是本地实体,有的则聚焦在政府和受监管行业(如金融、医疗、能源)的特定合规要求上。把"主权云"简单翻译成"国产云"或者"本地部署",容易忽略这些制度层面的差异,也容易低估企业在满足合规要求时需要投入的实际工作量。

为什么这个话题在AI时代变得更加迫切

AI大模型的训练和推理需要处理大量数据,其中不可避免会涉及企业内部信息、公民个人数据甚至涉及国家安全的敏感信息。当这些数据需要经过云端AI服务处理时,数据主权问题就从抽象的合规议题,变成了直接关系到关键业务能否安全运行的现实约束。这也是为什么近两年不少国家在推动本国AI基础设施建设时,会把主权云作为配套议题一并讨论——不是单纯反对使用全球化的云服务,而是希望在特定数据类别和关键业务场景上,重新明确谁真正拥有控制权和责任主体。

受影响最直接的几类行业

Sovereign Cloud的讨论并非对所有行业都同等重要。政府部门、金融机构、医疗健康、能源和国防相关产业,由于业务本身涉及大量敏感数据和关键基础设施,通常是各国主权云政策重点覆盖的对象;这些行业在选择云服务和AI基础设施供应商时,除了性能和成本,合规资质、数据本地化能力和应急响应机制往往会成为决定性的考量因素。相比之下,一般消费互联网企业面临的主权云合规压力相对较小,但随着AI应用渗透到更多行业场景,需要关注这类要求的企业范围也在逐步扩大。

企业在实践中如何权衡

对于需要同时兼顾全球化业务效率和本地合规要求的企业而言,一种常见的实践是采用混合架构:把不涉及敏感数据、对全球一致性要求较高的业务部署在全球化的云平台上,把涉及个人隐私、国家安全或关键行业合规要求的数据和业务,部署在满足当地主权云要求的基础设施上。这种权衡没有统一的标准答案,需要企业结合自身业务性质、目标市场的监管环境和实际运营成本,逐项评估之后做出选择,而不是简单地在"全部本地化"和"全部全球化"之间二选一。

评估一项"主权云"方案是否真正满足需求时,除了确认服务器物理位置,同样需要核实运营主体、适用法律和实际访问控制权限——这几项信息通常需要查阅具体的服务协议和合规文件,而不能仅凭营销材料中的"本地部署"字样做判断。

文中涉及的主权云定义和各国监管要求差异,基于公开政策讨论和行业分析整理,具体合规要求请以相关国家或地区官方发布的法规文件为准。

Related

相关知识拓展

电力从发电经过输电变电站到机架负载的传导路径示意图

电力传导链路

从发电到机架

AI机架结构示意图

AI机架结构

交换机、节点与配电

Scale-up与Scale-out两种网络扩展方式对比示意图

网络扩展方式

节点内与节点间

AI基础设施单位计算经济性示意图

单位计算经济性

Token与成本效率

返回鼎天国际官网 →