人工智能正在改变数据中心的电力消耗和分配方式。人工智能机架在有限的空间内集成了高密度处理器、高速网络设备、存储系统和冷却控制系统。它们的电力需求远高于许多传统服务器机架,并且会随着工作负载在训练、推理和空闲期之间的切换而发生剧烈变化。
这种转变给电源分配单元 (PDU) 带来了新的压力。适用于传统服务器的 PDU 可能缺乏 AI 集群所需的容量、监控细节或报警功能。因此,数据中心团队必须提出一个重要问题:当前的 PDU 是否能够应对不断增长的机架功率,还是已经成为未来发展的隐形瓶颈?
为什么人工智能机架电源会带来新的风险?
人工智能计算的扩展正在增加总用电量和机架级电力集中度。一项国际 能源与人工智能分析 预测到 2030 年数据中心需求将强劲增长。然而,对于设施团队来说,眼下最紧迫的问题是如何安全地将电力输送到每个机架。
货架负载过高会带来多种风险:
- 分支电路可能更快达到其极限。
- 连接器和电缆可能在更高的温度下工作。
- 相位平衡不良可能导致可用容量无法使用。
- 电压快速变化可能会触发警报或断路器。
- 人工巡检可能会遗漏短暂的负荷峰值。
- 新设备可能超出原有的电气设计范围。
机柜内可能仍设有开放式机架单元,但电力或散热能力不足以支持另一台服务器。这种闲置空间会降低灵活性,并可能迫使用户对电力基础设施进行昂贵的改造。
电源分配单元 (PDU) 未准备就绪的警告信号
PDU无需完全失效才会变得不适用。反复发出警报、连接过热、断路器无故跳闸以及电源记录缺失都可能表明机架已接近其设计极限。
操作人员应确定问题是出在配电单元 (PDU)、上游电路、电缆、配电盘还是连接的设备。有几个警告信号需要立即注意。
机架经常接近其极限
机架接近其电路额定值运行时,几乎没有空间应对工作负载峰值或新增硬件。平均读数可能看起来正常,但实际上可能存在短时间内更高的需求。
应参考最大电流和功率记录,而不仅仅依赖当前值。配电单元 (PDU)、分支电路、插头、导线和保护装置都必须能够承受预期的持续负载。容量规划应包括:
- 当前最大需求
- 短时功率峰值
- 计划新增服务器
- 机架级冷却设备
- 冗余的 A 和 B 馈线
- 所需电路裕量
当地电气法规也可能限制连续使用电流低于电路的额定电流。最终设计应由合格的电气专业人员审核。
断路器无故跳闸
断路器反复跳闸可能是由于过载、相序不平衡、设备故障或保护措施不当造成的。重置断路器可以恢复供电,但无法解决根本问题。
用于人工智能数据中心的智能PDU应在分支达到临界水平之前发出警告。分支级读数显示哪个插座组负载过高,而事件记录则帮助工程师将跳闸与特定的工作负载或设备变更联系起来。
操作员无法看到相位不平衡
三相电源在高密度机架中很常见,因为它可以在无需过多馈线电缆的情况下承载更大的负载。但是,设备必须正确分配到所有三相电源上。
当其中一相接近其极限时,其他两相仍有可用容量。合适的三相配电单元(PDU)应显示各相电流,并在出现不平衡或高负载情况时提供远程报警。
具备人工智能功能的电源分配单元 (PDU) 应该提供哪些功能
一款具备人工智能功能的PDU并非仅由一项高级功能定义。它必须与机架的电力需求、网络规则、物理布局、散热设计和维护流程相匹配。即使是高度智能的产品,如果输入插头、插座布局、安装方向或通信方式不匹配,仍然可能不适用。
以下功能对货架安全和日常管理影响最大。
合适的电气容量
首先确定电压、频率、相数、电流、插头类型和上游电路额定值。然后计算预期的机架负载,并预留未来扩展的实际空间。
对于高密度AI机架而言,高功率或三相PDU可能比标准单相PDU更合适。然而,如果上游分支电路无法支持,安装更高额定功率的PDU并不会增加可用容量。
应检查整个供电路径:
- 上游面板和断路器
- 分支电路和导线
- PDU 输入插头和电缆
- 内部保护分支
- 插座和设备电源线
- 服务器电源
额定值最低的组件可能成为真正的容量极限。
计量达到适当水平
不同的设施需要不同的计量细节。输入级计量显示机架总需求。分支监控识别哪个受保护的插座组接近其极限。插座级监控将能耗与特定服务器或设备关联起来。
一个 计量式PDU 可为安装和容量检查提供清晰的本地读数。大型设施、远程站点和频繁变化的 AI 集群可能需要联网监控、报警和更长时间的数据记录。
根据操作人员需要做出的决策选择测量点。只有当团队能够审查数据并采取行动时,更多的数据才有用。
实用报警和远程访问
远程PDU电源监控使工作人员无需巡检每个机架即可查看电流、电压、功率、能耗和相位平衡。它还有助于操作人员发现人工巡检可能遗漏的快速变化。
有用的功能可能包括:
- 安全网络访问
- SNMP通信
- 可配置的电流阈值
- 电子邮件或平台提醒
- 用户权限
- 能源和事件记录
- 可选的温度或湿度传感器
报警限值应在断路器跳闸前提供足够的响应时间。限值设置过低可能会导致重复警告,从而造成报警疲劳。
一个 智能管理型 PDU 还可以提供插座级别的控制。远程切换可以帮助授权团队重启设备,但用户角色、插座标签、确认步骤和事件日志至关重要。错误的命令可能会中断关键工作负载。
考虑热量、冷却和身体适应性
较高的用电负载会导致电缆、连接器、插座和服务器电源周围的温度升高。即使电流低于保护限值,连接不良或气流受阻也可能导致局部过热。
液冷式人工智能机架引入了额外的布局问题。管道、歧管、传感器和冷却液分配设备都会占用机架空间。电源分配单元 (PDU) 不应阻挡冷却组件,也不应放置在可能泄漏并造成不必要电气风险的位置。
下单前请核对以下信息:
- 零U型或水平安装
- PDU长度和机架兼容性
- 出口方向和间距
- 电缆入口点和弯曲半径
- 断路器和显示器访问
- 与冷却液管路分离
- 工作温度范围
- 出口保持功能
高密度机架式PDU应支持整洁的线缆布线和便捷的维护。安装位置不当会阻碍空气流通、妨碍服务器拆卸或增加检查难度。
保留真正的 A/B 电源冗余
许多人工智能服务器包含两个电源,分别连接到独立的A、B两条供电路径。这种设计可以在一条路径发生故障时保证设备继续运行,但前提是两条路径在电气上保持独立。
将两个配电单元 (PDU) 连接到同一个上游断路器、配电盘或电源会造成虚假冗余。即使存在故障,也可能导致两个电源同时断电。操作人员应追踪从设备电源到服务器输入端的每条路径,并记录任何共用组件。
每条路径可能还需要足够的容量来应对故障或维护期间的额外负载。正常运行时有效的设计,一旦某个电源中断,就可能过载。
KAILES如何支持高密度项目
在 凯尔斯我们提供广泛的 PDU产品系列 我们的产品涵盖基础配电、计量、远程监控、智能管理和大功率应用。我们服务于数据中心和其他对机架级稳定供电要求较高的环境。
通过我们 售前服务我们可以在生产前审核电压、电流、插座、通信、安装方式、保护措施以及未来容量需求。这有助于客户根据实际运行条件选择产品,而不仅仅依赖于标准型号。
交付后,我们的 售后服务 提供产品使用、维护和技术问题方面的支持。我们将PDU视为完整电源路径的一部分,而不是一个独立的机架附件。
PDU采购清单
在为人工智能机架订购电源分配单元 (PDU) 之前,请确认:
- 输入电压、相数、插头和电流
- 最大连续负荷和预期峰值
- 未来所需产能
- 出货口类型、数量和保持功能
- 输入、分支或输出端监控
- 网络协议和安全控制
- 必要的警报器和环境传感器
- A/B功率路径独立性
- 机架尺寸和冷却设备
- 认证、保修和支持要求
要求供应商在方案中列明所有技术假设。详细的答复更便于比较,也更不容易掩盖电气或物理方面的不匹配。
结论
人工智能机架功耗的不断攀升可能会使普通的电源分配单元 (PDU) 成为容量和可靠性的严重瓶颈。数据中心团队在安装高密度计算设备之前,应仔细检查整个电气路径。电流、相位平衡、分支负载、温度、物理适配性、监控覆盖范围以及 A/B 冗余等因素都需要考虑。
具备人工智能功能的电源分配单元 (PDU) 不仅仅提供额外的插座。它还能提供合适的容量、及时的电力数据、实用的报警功能,并更好地控制机架级风险。首先要测量需求,考虑峰值和未来的增长,然后选择能够支持实际运行决策的监控功能。随着人工智能基础设施的不断扩展,周密的规划可以减少断路器跳闸、隐蔽热点、闲置的机架空间以及中断性的更换工作。
常见问题解答
问: 什么是适用于人工智能数据中心的智能PDU?
答:它可分配机架电源,同时提供计量、报警、远程监控和可选的插座控制。
问: 数据中心何时应该更换其PDU?
答:当容量、监控、插座或通信功能不再满足机架要求时,应更换机架。
问: 三相PDU适用于AI机架吗?
答:是的。它能承受更高的负载,但操作人员必须监控并平衡所有三相电压。


