AI浪潮席卷之下,全球数据中心建设进入前所未有的狂飙期,锂电池、储能系统、固态变压器(SST)等供电设备需求随之水涨船高。然而,就在行业大举押注算力基础设施的同时,一场隐蔽的安全危机正在加速暴露。
据北极星储能网不完全统计,自2024年以来,全球数据中心安全事故呈井喷式爆发——从韩国647个政府系统一夜瘫痪、858TB数据永久损毁,到美国芝商所全球期货交易被迫停摆超11小时,再到阿里云、谷歌、AWS等头部云厂商轮番"翻车",事故影响已从单一企业的业务中断,一路升级到国家级政务瘫痪、全球金融市场停摆。
锂电池热失控、电气短路、液冷泄漏——这三大安全暗礁在全球数据中心集群浮出水面。如何构建稳定可靠的安全防护体系,已从一道技术选择题,变成了一道关乎行业存亡的必答题。
锂电池热失控与电气火灾
自2025年以来,有五起数据中心事故均涉及UPS锂电池,涉及企业包含阿里云、X公司等众多知名公司,其中尤以韩国国家信息资源管理院事故最为严重。此外,2025年3月巴西Equinix数据中心、2025年7月埃及开罗电信数据中心,均因电线短路、电气设备起火而引起火灾。
锂电池热失控火灾一旦触发,很难通过外部灭火手段阻断,且存在极高的复燃风险。如新加坡事故中消防浇水24小时仍未完全扑灭、韩国大田事故中电池在断电40分钟后仍自发爆燃,均印证了这一特性。另外值得注意的是,在数据中心内,电气短路产生的电弧也有可能触发邻近电池的连锁反应,继而导致严重火灾。如2025年7月埃及开罗电信数据中心大楼火灾,初步调查即指向电线短路。
为此,数据中心领域急需加强设备的安全设计。一方面,锂电池产品需增加主动安全设计,包括在电芯级别部署热失控传感器、在电池簇之间设置防火材料、采用浸没式冷却等手段抑制热蔓延;另一方面,也需辅以有效的监测预警和灭火措施,控制和消除火灾影响。
针对电气火灾,数据中心领域也应将电力领域的电气安全检测、电弧故障检测与保护系统等方案,引入数据中心供配电系统,进一步提升电气安全水平。
此外,数据中心选址阶段的气候风险评估应将暴雨、极端高温等参数纳入考量,在后期运维阶段也需加强定期风险排查,确认灾备设施的供水、供电和环境控制系统能够正常运行。
液冷热管理系统故障
2025年8月,韩国京畿道广州政府备用数据中心因暴雨导致空调水浸,无法承接灾备任务,致使大田主数据中心灾难扩大化;2025年底,东南亚某数据中心因液冷管道爆裂、冷却液泄漏导致服务器被迫中断。
为有效控制数据中心能耗,冷却热管理系统已成为维持正常运行的关键设施之一。尤其伴随AI算力需求激增,单机柜功率密度将飙升至50kW甚至100kW以上,机柜运行能耗更高,且高密度部署也导致热量更加难以疏散,液冷技术因而成为必选项。
2025年11月美国CyrusOne数据中心事故就是一起典型的热管理"失效"案例。因冷却塔结冰导致冷却系统失效,机房温度飙升至近49℃。事故发生在季节交替时冷却系统从压缩机制冷模式向自然冷源模式切换的过程中,两套热管理系统同时失效,最终导致事故发生。
而2025年8月韩国京畿道备用数据中心暴雨水浸导致的异常,也属于冷却系统故障范畴。
此外,韩国广州水浸事故和东南亚液冷管道爆裂也表明,液冷热管理系统需谨防泄漏事故,冷却介质一旦泄漏可能对IT设备造成直接损害。
此类事故表明,数据中心的冷却系统应考虑配备冷却液泄漏检测传感器与自动关断阀,并建立液冷系统的压力测试和定期巡检标准。此外,目前业内已有企业前瞻性提出浸没式液冷方案,将服务器置于绝缘冷却液中,冷却效果更优,也能避免部分电气事故。
随着AI应用提速,全球各国、各大企业都在密集推进AIDC建设,其中AIDC供电架构设计与储能锂电池等关键设施,是影响AIDC安全稳定运行的关键。9月10—11日,北极星将于河南郑州举办"2026年储能市场化创新暨AIDC储能应用论坛",期间多位演讲嘉宾将带来关于AIDC供电架构和最新技术方案的分享解读,了解咨询18911725159。
全球部分数据中心事故案例展示

新加坡Digital Realty SIN11数据中心锂电池爆炸火灾
2024年9月10日上午7时45分,位于新加坡罗央大道的Digital Realty SIN11数据中心触发火警警报。起火点位于三楼的电池室,UPS锂电池发生爆炸并引发火灾。新加坡民防部队迅速调集多辆消防车赶赴现场,动用四支水枪及无人消防机器人进行灭火,灭火行动持续超过24小时。
这起火灾未造成人员伤亡,但对阿里云新加坡可用区C的服务造成严重冲击。阿里云于北京时间10时20分检测到网络访问异常,受影响的云产品包括云数据库Redis、MongoDB、RDS MySQL,以及云原生大数据计算服务MaxCompute等17项关键云服务。Lazada、TikTok Shop等电商平台卖家反映无法同步订单,字节跳动等托管服务也严重中断。Digital Ocean、Cloudflare等公司同样报告了服务降级。
更为复杂的是,消防部门对数据中心持续浇水,导致服务器机房出现积水和漏水,并带来电气短路风险。9月11日凌晨1时46分,Digital Realty被迫对其中一栋服务器大楼实施紧急断电。直到9月12日17时25分,阿里云运维人员才获准进入大楼一层区域进行设备评估和保全。
印度Reliance Jio数据中心火灾致全国网络中断
2024年9月17日早晨,印度最大电信运营商Reliance Jio位于孟买的数据中心发生火灾,导致全国范围内的用户网络中断。受影响的服务涵盖移动网络、移动互联网、宽带以及JioTV+和Jio AirFiber等。印度孟买、海得拉巴、德里、加尔各答、班加罗尔等主要城市均受到影响,电信服务中断持续数小时。
消防队在数小时内控制了火势,Jio于当天15时40分恢复了大部分服务。值得注意的是,Jio官方声明将此次事件轻描淡写为"小技术问题",并未公开承认是数据中心火灾所致。火灾具体原因至今未正式公布,有消息人士透露是数据中心火灾导致,但Jio未予确认。
美国俄勒冈州X公司数据中心电池室火灾
2025年5月22日清晨,位于美国俄勒冈州Hillsboro科技园的一处数据中心发生火灾,该数据中心为马斯克旗下X公司租用。火灾发生在存放备用电源电池的房间内,紧急救援队伍进行了近5小时灭火行动才控制火情,所幸未造成人员伤亡。
公开信息显示,火灾发生后X平台出现大规模服务中断。但X公司未就火灾发表正式声明,也未确认火灾与服务中断之间的关联。
谷歌us-east5-c服务区UPS电池故障致云服务中断
2025年3月,谷歌位于us-east5-c服务区的数据中心在市电中断后,UPS电池发生严重故障,未能正常切换供电。此次故障导致20多项谷歌云服务中断约6小时。事故过程中,UPS电池未能在关键时刻承担起过渡供电的职责,使得本应作为"最后防线"的备用电源系统形同虚设。
巴西Equinix SP4数据中心火灾致拉美互联网枢纽瘫痪
2025年3月30日当地时间12时34分,全球托管服务巨头Equinix位于巴西圣保罗某商业园区的SP4数据中心发生火灾。火灾发生在一家未具名暗光纤供应商的机架内,起火源涉及客户的电气设备。Equinix在官方声明中表示,此次事件是被控制在局部范围内、未蔓延至整个设施的小规模火灾。
火灾导致Equinix Fabric平台与谷歌云(GCP)、甲骨文云(OCI)的虚拟互联通道瘫痪,Starlink卫星互联网、社交平台X及游戏《Free Fire》等出现大规模访问异常。该数据中心直到次日8时20分才完全修复,整个故障持续近20小时。
当地媒体称,火灾原因疑似为新到货设备包装材料未拆除即通电引发短路,但Equinix未予证实。另有行业分析指出,初步调查指向设备包装材料可能为火源。
埃及开罗电信数据中心大楼火灾
2025年7月7日晚间,埃及电信公司的关键电信数据中心大楼发生火灾,最终造成至少4人死亡、33人受伤(其中包括10名警察),伤者多为吸入性损伤。
事故导致数据中心部分主要电缆和重要服务器受损。作为安全应急措施,整座电信大楼被迫断电,随即导致开罗地区大面积通信中断,民众无法拨打电话、无法正常连接互联网,数字银行服务同样受到严重影响,开罗国际机场部分航班延误。
韩国京畿道广州政府备用数据中心水浸
2025年8月,韩国京畿道广州的政府备用数据中心因暴雨导致2号机房空调系统水浸,近两成机柜离线。这一事件在当时并未引起广泛关注,但在一个月后的大田主数据中心火灾中暴露出致命后果——当大田NIRS总部因火灾导致647个政府系统瘫痪时,本应承接灾备任务的广州备用中心因自身处于水浸修复状态而无法承担备份重任,直接导致了韩国史上最严重的数据灾难的扩大化。
韩国国家信息资源管理院火灾致政府数据丢失
2025年9月26日晚20时20分,位于韩国大田市的国家信息资源管理院(NIRS)总部5层7-1计算机房发生特大火灾。火灾发生在UPS锂电池搬运过程中——工人正在将一组已断电的锂电池从5层机房转移至地下室,断电约40分钟后,其中一组电池突然发生爆燃。
涉事电池由LG能源解决方案公司生产的三元锂电池,自2014年安装投运后已服役11年,超过了10年的建议使用期限。2024年6月,LG在例行检测中已发出警告要求立即更换,但管理院负责人李在庸认为系统重还有2017年生产的电池,因预算原因拖延了更换。
调查发现,工人在作业时虽切断了主电源,但未切断电池架辅助电源,也未穿绝缘服、未对工具做绝缘处理。而且UPS是使用直流电,在未完全断电的情况下断开线路会导致瞬间电压飙升,极大增加了起火风险。
约170至200名消防员在60多辆消防车支援下赶赴现场。消防部门认为大量用水可能加剧电池损坏或引发服务器之间火势蔓延,于是采用二氧化碳灭火系统和谨慎的通风手段控制火情。火灾于27日6时30分基本被控制,但当天上午部分复燃,直至27日18时才被完全扑灭,整个过程持续约22小时。消防人员从现场移出了近400组已被烧毁的锂离子电池组。
此次火灾导致一名工作人员面部和手臂被灼伤,并导致647个政府核心业务系统瘫痪,占韩国政府全部在线信息系统的近三分之一。其中96个系统被直接烧毁,551个因温度问题被预防性停机,韩国政府门户网站、居民身份证、金融支付清算系统等均受到严重影响。
更为严重的是,政府文件存储系统未进行外部备份,导致约75万名公务员近7年的工作文件全部丢失,共计约858TB数据永久损毁。
韩国总统李在明因该起事故向国民致歉,数据中心主任因玩忽职守被免职,警方逮捕了4名涉嫌失职的人员。最终,受影响的全部693个系统在火灾后49天才完全恢复正常。
美国CyrusOne CHI1数据中心冷却系统故障致芝商所全球交易停摆
2025年11月27日晚至28日晨,位于美国伊利诺伊州奥罗拉市(Aurora)的CyrusOne CHI1数据中心因冷却系统故障导致机房温度飙升至近49℃,超过美国行业规定上限约48%,致使芝加哥商业交易所集团(CME)旗下Globex期货与期权市场、EBS外汇平台、BMD棕榈油期货等全平台交易暂停超过11小时。包括原油、黄金、白银、铜在内的核心大宗商品价格陷入"横盘僵局",外汇交易平台EBS上欧元对美元、美元对日元等主要货币汇率报价也停止更新。
事故发生在季节交替时,冷却系统从压缩机制冷模式向自然冷源模式切换的过程中,现场工作人员及承包商未按标准对冷却塔进行排水,导致冷却系统结冰超压运行。冬季自然冷却模式制冷量不达标,同时夏季压缩机制冷模式的冷塔供水管路因冻结而无法使用,两套系统同时失效,最终引发热失控。此外,CyrusOne最初的补救措施反而加剧了问题,最终导致多台冷却器故障。
最终,该数据中心相关责任人被解雇。
东南亚某数据中心液冷管道爆裂致GPU集群瘫痪
2025年底,东南亚某数据中心的一根顶部架空液冷管道发生爆裂,大量冷却液泄漏导致整个通道被水覆盖,一组最新型号的GPU服务器集群被迫下线,约十余个机柜受到影响。据科技媒体TechStories报道,每个机架价值数百万美元,即便只有一个机架受损也意味着灾难性的财务损失。
行业分析认为,由于熟练技术人员短缺以及多层分包商的存在,施工工艺不佳可能是导致管道爆裂的原因。也有建议指出,数据中心应液冷管道铺设位置有问题,应该设置在服务器机架下方而非上方,并应该配备集水陷阱。
微软Azure West US数据中心变压器故障致断电
2026年2月7日7:52,微软位于美国加州圣何塞的Azure West US数据中心一台变压器发生电气故障,导致市电输入被切断,随后UPS电池组立即启动接管。不过,虽然发电机正常启动,并机控制系统却因过电压事件导致控制电源失电,无法完成自动切换。UPS电池在AI高功率负载下仅维持约4至6分钟便完全耗尽,数据中心就此全面断电。
有分析指出,故障根源在于内部电力架构的多环节连锁失效:电缆额定值选型不当,产生高达正常值130%的电压浪涌;过电压保护继电器整定值未有效配置,导致未收到分闸指令,过电压直接传导至下游UPS系统;UPS整流器超出半导体元器件耐受极限后触发保护性关机;最后,发电机并机控制系统的控制电源也因过电压事件失电,无法完成并机切换。
欧洲Exoscale数据中心UPS电池室火灾
2026年3月16日,欧洲云服务商Exoscale位于瑞士的数据中心UPS电池室发生火灾。此次火灾虽被及时扑救,未直接影响上层业务系统,但电力系统因安全需要被强制中断,导致供电冗余从N+1降级为N级,并持续了6天之久。在这6天内,任何一次市电闪动都可能导致全楼宕机。
印尼雅加达Linode数据中心市电波动致服务中断
2026年3月20日,印尼雅加达市电出现波动,令Linode数据中心备用电源启动并导致设备重启,但UPS未能正常响应,最终引发服务中断。该事件暴露了传统UPS更侧重停电切换,而对电压骤降、波形畸变等电网质量事件兼容性不足的问题。
AWS北弗吉尼亚数据中心过热宕机
2026年5月7日下午,AWS位于美国弗吉尼亚州北部的数据中心部分区域发生散热异常,机房内部温度快速升高,导致部分受影响硬件断电。
事件导致加密资产交易平台Coinbase交易服务中断近7小时,体育博彩平台FanDuel同步受影响,亚马逊卖家后台也出现大范围瘫痪,超150项云服务受影响。
业内普遍认为,这起事故是AI突发大规模负载需求导致的。就在事故发生的不到一周前,AWS刚刚宣布将扩大北弗吉尼亚州的数据中心容量,以应对AI算力需求的激增。
微软Azure West US 2数据中心再次发生供电事故
2026年5月29日,Azure West US 2数据中心再次发生电力系统故障,导致超过20项服务降级。受影响服务包括App Service Web无法访问、Storage Account对象存储访问异常,以及Azure OpenAI多区域推理服务中断。值得注意的是,这是同一区域(Azure West US)不到4个月内发生的第二起电力事故,但事故原因暂未披露。
印度新德里第三方数据中心火灾影响谷歌云服务
2026年6月5日凌晨约2时47分,印度新德里一栋多层建筑三楼的电池房发生火灾,该设施与印度塔塔公司相关。当地消防部门出动11辆消防车处置,火势被限制在一间约200平方英尺的电池房内,并在当天上午7时被控制。火灾造成两名消防员手部烧伤,起火原因仍未查明。
火灾引发的紧急断电切断了谷歌云在德里的本地网络接入点(POP),导致来自德里、孟买、金奈及周边地区的部分谷歌云服务异常。据Google Cloud官方记录,该事件影响从6月5日持续至6月26日,长达21天12小时。
谷歌云荷兰数据中心供电及制冷失效
2026年7月16日凌晨,谷歌云位于荷兰Eemshaven的数据中心因公共电网发生电气故障,导致内部供电与制冷系统连锁失效。初步调查报告显示,上游电网出现约3毫秒的电压瞬态,由于A/B双路市电均连接至Robbenplaat 220kV变电站,同一电压瞬态同时影响了两路供电;其中B侧DRUPS成功接管,但A侧DRUPS因电气部件故障未能成功切换;在将A侧负载转移至B侧的过程中,第3排机柜因过载保护断路器跳闸,导致两路电源同时丢失——Google指出实际IT负载部署与设计预期存在偏差,B侧无法完整承接。
与此同时,3毫秒电压瞬态期间冷机控制器掉线,冷却水分配泵未自动重启,导致整体冷却能力骤降。加之部分冷却冗余不可用,最终导致机房温度超过44℃,谷歌因此被迫主动关闭全部服务器、存储集群和网络交换机,以防止硬件永久损坏。谷歌云的三项核心服务因此中断近15小时。
( 来源: 北极星储能网 作者: 清稚 )