给液冷 GPU 云用的冷却液可靠性控制平面——在污染拖垮机架前,先把维护动作排好。
液冷 GPU 运营商现在扛着一种通用设施软件管不好的新可用性风险:冷却液污染、泵磨损和密封件老化会悄悄累积,最后逼出紧急冲洗或整机架停机。多数团队今天还在靠人工取样、OEM 服务电话和事后应急手册,所以往往先知道出问题了,却不知道下一步该怎么动。一旦一排机架对应的是价值数百万美元的训练或推理产能,冷却液化学状态就不再只是设施细节,而是有人真正管预算的运营问题。
为何现在
- 单次冷却液事故的代价已经高到足以拿到直接运营预算,因为一条受污染的回路就可能让承载收入的机架停摆,并烧掉数百万美元。
- 在线光谱仪让冷却液健康度变成连续可见的数据,这才给软件提前给出处置建议打下底座,而不是等故障肉眼可见后再补救。
- 同一套遥测现在不只会抓细菌,还能发现泵磨损和密封老化,于是切口能从监测往完整维护决策扩。
- Omen 已经点名 12 家数据中心客户,其中包括 TensorWave,这说明早期客户群已经成形,不再只是单个实验性部署。
催化因素。 Omen 的融资、12 家客户进展,以及“污染会让机架停摆 5–6 小时”的说法,都说明液冷化学状态已经从设施细节跨进了有预算的 GPU 可用性风险。
创意
先做一套中立的冷却液可靠性控制平面,压在传感器、CDU 遥测和维护工单之上。产品会给每条回路、每个机架分区和每一批冷却液建数字护照,再把异常信号翻成具体动作:该补药、该隔离、该冲洗、该换件,还是该排一个计划内维护窗口。系统还会判断最可能的故障模式、谁该批准这次响应,以及这起事故是不是该转成质保或供应商质量索赔。时间一长,平台会学会不同回路设计下,哪些化学信号和处置步骤真的能把停机挡住,让运营团队不再每次都拉应急战情室。
差异化。 传感器厂商和冷却 OEM 要么只露出测量值,要么卖和单一回路设计绑定的硬件;但采购方真正缺的是一层中立系统,能告诉他们该冲洗、隔离、加药、换件,还是把事情升级成质保索赔。通用 DCIM 事后能看到温度和告警,却不会跨混合机群去推理冷却液化学状态、故障模式和维护经济账。真正的护城河,是一套跨站点数据集:把流体特征、处置动作、供应商组合和停机结果一条条连起来。
| 滩头市场 | 先打北美 GPU 云服务商:他们已经运营 1–5 个直触式液冷机房,要对客户承担可用性 SLA,泵、冷却液和歧管又往往来自不同供应商,结果谁都没有真正拍板流体健康的职责。 |
|---|---|
| 切入点 | 一套冷却液可靠性控制平面,把在线流体遥测、维护日志和厂商规范并到一起,给每条回路打健康分,推荐冲洗、隔离或检修等动作,并在停机前把可用于质保索赔的事故记录留齐。 |
| 非显而易见洞察 | 真正冒出来的新控制点,不只是冷却硬件,而是把冷却液当成可消耗可靠性层来运营的软件系统。变化已经发生:液冷 GPU 机架在快速铺开,在线光谱仪让流体健康度可以持续测量,而一次持续数小时的停机,如今已经贵到足以单独批出软件预算。 |
| 风险投资级路径 | 先从 GPU 云的运行期冷却液可靠性切入,再往调试投运、供应商横向对标、备件规划、保险与贷款方报告,以及液冷 AI 机群的主记录系统扩。 |
| 主要用户 | 北美 GPU 云运营商里负责数据中心可靠性的总监,管理直触式液冷集群,并对外承担客户可用性 SLA。 |
|---|---|
| 次要用户 | 负责回路维护、供应商协同和事故响应的设施可靠性工程师,或液冷项目经理。 |
| 经济买方 | GPU 云服务商或 AI 托管数据中心运营商里的数据中心运营 VP 或 COO。 |
| 首个客户 | 北美 GPU 云服务商里的数据中心运营 VP:他们正为对外训练或推理租户上线第二个 2–10 MW 液冷机房,也刚意识到 OEM 的点状工具管不了跨厂商的冷却液决策。 |
|---|---|
| 购买触发点 | 新的液冷机房要上线,而且对外承诺可用性 SLA;尤其是在赶部署进度、不得不引入第二家冷却液、泵或歧管供应商的时候。 |
| 当前替代方案 | 人工冷却液取样、OEM 维护手册、电子表格应急手册,以及通用 BMS / DCIM 告警。 |
| 切换理由 | 这家创业公司能把原始流体数据翻成中立的维护决策和证据,减少突发冲洗、机架停机,以及事故后的相互甩锅;这些问题,点状工具和服务合同都解决不了。 |
| 定价假设 | 按每个在管液冷机房或每 MW 收年费订阅;每出现一种新回路拓扑,再收一次导入费。 |
待完成任务
| 任务 | 当前替代方案 | 成功指标 |
|---|---|---|
| 当一座承载收入的液冷机房满载运行时,帮运营负责人判断哪条回路该介入、该排什么维护动作,这样他们就能躲开紧急机架冲洗和计划外停机。 | 人工取样、OEM 告警和被动拉起应急战情室。 | 避免掉的计划外机架停机小时数,以及从异常出现到动作获批的平均时长。 |
| 当污染或磨损事件冒头时,帮可靠性团队把根因和质保记录整理出来,这样他们既能追偿,也能避免同样的故障继续蔓延到别的机房。 | 电子表格事后复盘、供应商互相甩锅,以及人工翻工单。 | 判定根因所需时间,以及不必整机架停机就能结案的事故占比。 |
flowchart LR Buyer[GPU cloud ops leader] --> Pain[Contamination or wear can idle revenue-critical racks] Pain --> Product[Coolant reliability control plane] Product --> Outcome[Planned maintenance and higher GPU uptime]
- 信号 · 4/5这个信号群把停机经济账、硬件细节和早期客户证明都摆了出来,而且两篇来源能互相印证;只是证据纵深还不够。
- 痛点 · 5/5一次冷却液故障就能让昂贵的 GPU 机架停摆数小时,可用性、收入和客户信任都会立刻受伤。
- 切入点 · 5/5活跃液冷机房里的冷却液维护决策,是一条边界很清楚的工作流:采购方、触发点和替代方案都摆在桌上。
- 防御性 · 4/5只要能把化学信号、故障模式和有效处置步骤沉淀成一套中立数据集,护城河就会越积越厚,哪怕 OEM 也会给出更轻的监测工具。
- 规模化 · 4/5滩头市场很具体,但一旦跑通,就能往投运、质保、保险、采购和全机群运营一路扩进液冷 AI 基础设施栈。
- 在线传感器厂商
- 液冷 OEM 和 CDU 供应商
- 数据中心维护承包商
- 保险公司和质保服务商
- 回路健康建模
- 维护工作流编排
- 可靠性横向对标与根因分析
- 跨站点的冷却液故障与处置数据集
- 对在线传感器、DCIM 和维护系统的集成
- 覆盖流体化学、泵、密封件和质保流程的领域操作手册
- 把冷却液污染和部件磨损引发的突发机架停机挡在前面
- 把原始冷却液遥测翻成清楚的维护动作和质保证据
- 跨机房、跨供应商、跨维护团队比较回路健康度
- 按机房做高触达导入
- 围绕避免掉的事故做季度可靠性复盘
- 从单机房扩到全机群的冷却液治理
- 直销数据中心运营负责人
- 和液冷 OEM 及现场服务伙伴合作
- 先和正在新建机房的 GPU 云运营商做共创客户
- 运营液冷集群的 GPU 云服务商
- 提供液冷算力的 AI 托管数据中心运营商
- 管理多站点机群的液冷服务商
- 可靠性与软件工程
- 传感器和维护系统集成
- 现场实施与客户成功
- 流体系统与运营领域专家
- 按每个液冷机房或每 MW 收年度软件订阅费
- 一次性导入费和数字护照配置费
- 高级横向对标与质保分析模块
市场
| TAM | $300.0M 按到 2030 年全球约 1,200 个液冷 AI 机房 × 每个机房约 $250k 的年度冷却液可靠性软件预算来建模,得出 $300.0M TAM。机房数量锚定 JLL 的 100 GW 扩建、TrendForce 预测液冷渗透率从 14% 拉到 33%,以及 Equinix 超过 100 个 IBX、NTT 200+ MW AI 部署等公开部署版图,再和直触式液冷市场报告交叉校验 [4][5][6][7][55][56]。 |
|---|---|
| SAM | $36.3M 先把 TAM 按北美 34.6% 的增长份额切下来,再进一步只保留符合滩头画像的约 35% 北美液冷机房:第三方 GPU 云和 AI 托管数据中心运营商、拥有 1–5 个机房、并对外承诺 SLA [6][9][12][55][56][58]。 |
| SOM | $3.0M 第 3 年可达情形,是同样按每个机房 $250k ARR 计,签下 12 个机房;也就是大约 8–10 家运营商各落 1–2 个机房。和 Equinix、NTT、Flexential 已公开的液冷部署版图相比,这个目标仍明显偏保守 [9][12][40][55][56][58]。 |
高管要点
- 冷却液健康度正在变成单独预算项,不再只是设施侧的小麻烦:Omen 说,细菌污染会逼出 5–6 小时机架停机;ITIC 给出的更广义基准则是,90% 的中大型企业认为每小时停机成本超过 $300k [1][40]。
- 液冷已经从试点走到设计标准:TrendForce 预计 AI 数据中心液冷渗透率会从 2024 年的 14% 跳到 2025 年的 33%;JLL 说,AI 训练机房已把单机架功率推到 40–100+ kW;Equinix 也在 45+ 个都会区的 100 多个 IBX 扩直触式液冷能力 [4][7][55]。
- 竞争缺口不在感知本身,而在中立决策层:Ecolab、Pyxis、Schneider、Danfoss 和 Accelsius 都覆盖了监测或热管理硬件,但没有谁公开拿下跨供应商处置逻辑,以及可用于质保的事故记录 [14][27][31][41][45][49][50]。
- 执行风险确实存在:Schneider、OCP、ASHRAE 和 Uptime 都在提醒,混合供应商回路的规范差异、可维护性取舍,以及主动冷却液质量控制,都会让 DLC 的运营复杂度长期高于成熟空冷 [15][22][23][26]。
市场定义
面向液冷 AI 数据中心的中立冷却液可靠性软件:一层压在 CDU、化学传感器和维护工单之上的控制层,把冷却液健康度和污染信号翻成直触式液冷及相邻液冷系统的处置决策 [4][6][14][21][45][49]。
用户与买方
滩头采购方,是 AI 云和托管数据中心运营商里 VP 或总监级的数据中心运营 / 可靠性团队;他们正在上线 5–20+ MW 的机房块,单机架密度往 50–100 kW+ 走,而且可用性预期已经写进对外承诺里 [9][12][55][56][58]。
购买触发点
- AI 机房新上线或改造后,机架功率冲到 40–100+ kW,液冷已经躲不开。 [4][7][9][14]
- 部署里混入多家供应商后,质保口径、回路隔离规则和维护协议开始变得说不清。 [15][22][26]
- 一旦出现污染、pH 漂移或颗粒物事件,团队会立刻发现:人工取样对在线 AI 算力来说太慢了。 [1][27][36][49]
支付意愿
只要一场冷却液相关事故就会让机架停摆 5–6 小时,而企业停机成本又普遍超过每小时 $300k,那么在 5–20+ MW 的 AI 站点里,单独列出一笔六位数年费可靠性预算就讲得通——哪怕公司还没开始全机群铺开 [1][9][40]。 [1][9][40]
品类动态
顺风因素
- AI 机架功率增长已经把空冷甩在后面:TrendForce 提到 GB200 机架可到 130–140 kW,JLL 也把 AI 训练机房放到 40–100+ kW / 机架。
- 运营商正在公开放大 AI 就绪液冷产能:从 CoreWeave 的超大集群,到 Equinix 100+ 个 IBX,再到 NTT 的 200+ MW AI 部署。
- 温液回路和化学传感器在成熟,主动监测终于变得实用:NVIDIA 在推 45°C 设计,Ecolab 和 Pyxis 也都在上化学监测系统。
逆风因素
- 把旧设施改成液冷机房,比新建 AI 机房更慢、更烧钱;尤其在电力和设备交付周期拉长时更是如此。
- DLC 的韧性标准还不成熟;Uptime 明确说,行业对并发可维护性和容错性仍没有统一共识。
- 冷却液化学治理本身就复杂:一旦腐蚀、生物膜或颗粒污染失控,冷板和换热器都会被拖坏。
验证信号
- Omen 说,它的传感器已经部署在管理 10–14 GW 容量的数据中心客户里。
- Equinix 计划在 45+ 个都会区的 100 多个 IBX 里支持直触式液冷。
- NTT 表示,企业在 2024 年为 200+ MW 的 AI 部署选用了其液冷 AI 就绪站点。
- Ecolab 已经发布直触式冷却液健康监测产品,并带性能洞察、现场服务和实验室支持。
- Accelsius 背后站着 Johnson Controls 和 Legrand,也已经有在线实验室和参考部署。
监管与技术约束
- CDU 应该把设施水系统(FWS)和技术冷却系统(TCS)隔开,而且要主动做冷却液质量与过滤监测,不能只靠“回路自己会稳定”。
- 混合供应商回路必须把温度、压力、流量和维护协议逐条对齐;Schneider 甚至建议,一旦要求不一致,就按服务器型号把 TCS 回路分开。
- 铜冷板和多金属微通道系统,对腐蚀、颗粒侵入和生物污染都很敏感;只要化学状态跑出控制带,退化就会加速。
- 围绕 PUE 和 WUE 的压力只会变大,所以温液、闭环或低水耗架构,会在选址和供应商选择里越来越重要。
竞争
竞争大致分成三层:监测创业公司(Omen、Pyxis)、化学与水处理现有厂商(Ecolab、ChemTreat、Dow、Veolia),以及冷却 OEM / 平台厂商(Schneider、Danfoss、Johnson Controls、Accelsius)。这中间仍留着一层空白:能跨混合回路做中立编排,并产出可用于质保的证据,而不是再给买方一个传感器看板 [2][27][31][32][41][45][46][49][50][51]。
| 竞争对手 | 阶段 | 切入点 | 定价 | 优势 | 相对劣势 |
|---|---|---|---|---|---|
| Omen AI | seed | 用在线光谱仪持续读取冷却液和工业流体健康度。 | 企业定制报价;公开材料里没有列出价格。 | 它是最接近本案的直接信号:冷却液化学监测已经成了一条拿到融资、也有早期部署故事的 AI 基础设施赛道。 | 公开定位仍偏传感器优先;在跨混合机房的中立处置工作流和质保编排上,材料里写得远不够明确。 |
| Pyxis Lab | scale-up | 装在 CDU 上的多参数冷却液化学分析仪和 AI 冷却回路传感器。 | 硬件与仪表销售;公开材料里没有列出价格。 | 对 pH、电导率、浊度、乙二醇浓度等关键指标覆盖很全,也支持直触式液冷环境里的 DCIM / BMS 集成。 | 它卖的是监测仪表,而不是跨站点横向对标、决策逻辑或事故证据工作流。 |
| Ecolab | incumbent | 从站点到芯片的水和冷却液管理,带实时监测、现场服务和实验室支持。 | 服务合同和企业级方案销售;公开材料里没有列出价格。 | 全球现场网络、化学可信度,以及把监测和更大水治理项目一起打包的能力都很强。 | 它的核心仍是处理与服务项目,而不是针对混合 AI 机房做中立维护决策。 |
| Schneider Electric / Motivair | incumbent | 面向 AI 数据中心的参考设计、CDU 和直触式液冷基础设施。 | 按项目报价的基础设施销售;公开材料里没有列出价格。 | OEM 关系深,对架构、改造和高密度 AI 冷却切换有很强的话语权。 | 它仍更偏硬件和实施;一旦园区里混入多家供应商,买方还是需要一层中立运营层压在栈上。 |
| Accelsius | scale-up | 把两相直触式冷却平台当成 AI 热管理基础设施一起卖。 | 基础设施平台销售;公开材料里没有列出价格。 | 效率叙事清楚,又有 Johnson Controls 和 Legrand 这种战略背书,正好踩在 AI 工厂迁移浪潮上。 | 它卖的是冷却架构选择,而不是能压在任何回路设计之上的中立控制平面。 |
为什么现有厂商不会默认胜出
- 冷却 OEM. 他们卖 CDU、歧管和参考设计,但混合供应商机房仍需要一套中立规则来处理回路隔离、质保对齐和跨硬件升级;没有哪家 OEM 能从头到尾把这层全部接住。
- 水处理现有厂商. Ecolab、ChemTreat、Veolia 和 Dow 的化学能力与现场服务都很强,但它们的产品核心仍是处理方案和检测服务,而不是把整座 AI 机房的机架级维护编排起来。
- 云与托管数据中心运营商. 大运营商当然能自己做内部工具,但大量 AI 部署仍发生在第三方托管数据中心和新型云服务商环境里;这里的买方更想要中立的运营证据,而不是再被某一家平台绑定。
- 通用 DCIM / BMS 工具. 现有基础设施工具能吃告警和遥测,但 Pyxis 和 Ecolab 的新产品都在说明,冷却液化学状态需要自己的一套参数、分析逻辑和告警模型,不是通用监测顺手就能带上的。
商业计划
冷却液可靠性控制平面,最该先卖给北美 GPU 云和 AI 托管数据中心运营商:他们已经在直触式液冷机房里对外承诺可用性 SLA,却还得跨泵、CDU、歧管和冷却液供应商协调维护。痛点既具体又昂贵:Omen 说,细菌污染会逼出 5–6 小时的机架停机;更广义的停机基准也说明,财务敞口已经大到足以单独批一笔运营软件预算。最理想的首批客户,是正在上线第二个液冷机房、或刚把多家供应商混进同一园区的数据中心运营 VP 团队,因为这正是职责断层和质保归责最容易失控的时候。MVP 应该先吃现有 CDU、化学、BMS/DCIM 和工单数据,给每条回路建护照、给回路健康打分、推荐由人批准的处置动作,并自动整理成可用于质保的事故记录。第一阶段要刻意不碰传感器硬件,也不去替代 DCIM;真正的切口,是跨混合机群做决策和证据,而不是再做一个遥测看板。按研究测算,TAM 约 $300.0M,滩头 SAM 约 $36.3M;如果公司在第 3 年签下大约 12 个机房,再往横向对标、投运支持和保险 / 贷款方报告扩,SOM 可做到 $3.0M。最大的战略上行空间,在于每次部署都会沉淀一套专有数据:化学特征、供应商组合、处置动作和停机结果会越积越厚。最悬而未决的问题,是事故到底有多频繁、预算归谁,以及在不加新硬件的前提下,现有遥测究竟够不够用;所以前 12 个月必须证明,软件先行的部署真能跑通,也真能换来六位数年费合同。
问题
- 冷却液污染、pH 漂移、泵磨损和密封老化,会在直触式回路里一路累积,直到运营方被迫面对紧急机架冲洗,或持续数小时的停机,以及随之而来的 GPU 收入和 SLA 风险。
- 多数团队今天还在靠人工取样、OEM 服务手册、电子表格和通用 BMS / DCIM 告警来管这件事,所以混合供应商环境里始终缺一套中立系统,能真正拍板该怎么介入,也能把质保证据记完整。
解决方案
- 做一套中立控制平面,吃进 CDU 遥测、冷却液化学数据、维护日志和厂商规范,给每条回路打健康分,并推荐下一步动作。
- 先把人留在环里:从建议、回路护照、升级流程和事故证据包做起;只有等工作流被信任之后,再往全机群横向对标、投运支持和外部报告扩。
为什么我们会赢
- 冷却 OEM、化学供应商和监测创业公司要么卖硬件,要么露数据;但采购方真正缺的,仍是一套跨供应商的主记录系统,能把处置逻辑、质保口径和事故后证据串在一起。
- 每次部署都会把化学特征、供应商组合、处置步骤和停机结果沉淀成专有数据;这套可靠性数据集,比单一传感器数据流更难被替代。
| 滩头市场 | 北美 GPU 云和 AI 托管数据中心运营商:他们在同一园区里运行 1–5 个直触式液冷机房,对外承诺可用性 SLA,而且冷却栈至少混用两家供应商。 |
|---|---|
| 切入点理由 | 这条入口比“通用数据中心监测产品”更容易更快拿到证明,因为机房投运和混合供应商切换,会把痛点、预算和可量化结果都压到同一个时点。若一上来就想覆盖所有数据中心,或所有液冷架构,销售只会变慢,也更难看清产品究竟有没有避免昂贵的维护误判。 |
| 推进顺序 | 先用现有遥测把回路护照、告警分诊和证据包跑起来,这样试点不必带新硬件,也不会碰控制路径风险。等至少 2 个试点转正后,再加横向对标和第二机房扩张;至于投运、备件规划和外部报告,要等公司手里攒够处置结果数据,模块才会有说服力。 |
| 暂不进入 | 浸没式冷却,或超大规模云厂商的定制液冷部署。 · 自研传感器硬件,或由 OEM 独占的监测设备。 · 通用 DCIM 或 BMS 替代方案。 · 把节水、保险报告或贷款方报告做成第一款 SKU。 |
| 切入点 | 先在一座刚投运或刚扩容的液冷机房里,拿下一单付费试点;这里既有混合供应商,又要对外担 SLA,人工取样和 OEM 点状工具都已经不够用。 |
|---|---|
| 渠道 | 在投运窗口期,由创始人直接卖给 GPU 云和 AI 托管数据中心运营商里的数据中心运营 VP、COO 与可靠性负责人。 · 和正在上线第二个机房、或想把多机房液冷流程标准化的运营商做共创客户试点。 · 首个标杆客户跑出来后,再和 CDU 厂商、冷却液服务商及化学合作方做转介绍与联合销售。 |
| 漏斗目标 | 目标账户 -> 合格初筛沟通 20–30%,合格初筛沟通 -> 付费试点 15–25%,付费试点 -> 年度正式部署 50%+,正式部署 -> 12 个月内扩到第二个机房 40%+。 |
| 定价 | 先做一个 10–14 周的付费试点,单机房定价约 $60k–$120k;转正后按每个液冷机房每年约 $180k–$300k 收订阅费,再加回路护照配置和集成导入费。采购方买的不是传感器或账号席位,而是更少的停机、更快的处置和更硬的质保证据。 |
| MVP | MVP 要先吃现有遥测:把 CDU 和化学信号、维护工单及厂商规则并进来,给每条回路建护照、标出越界项、推荐隔离、冲洗、加药或检修动作,并自动生成可用于质保的事故记录。第一版必须坚持人留在环里,也不要强推自动控制或新硬件。 |
|---|---|
| 6 个月 | 落地 2–3 个付费的单机房试点,证明回路护照、动作建议、事故时间线,以及“上线前 / 上线后”的停机和人工对照报告都能跑通。 |
| 12 个月 | 至少把 2 个试点转成年度订阅,交付主流 CDU、BMS/DCIM、化学监测和工单栈的标准集成,并在现有客户里上线跨机房横向对标。 |
| 24 个月 | 等公司在大约 8–12 个机房里拿到可引用的证明后,再往多站点冷却液治理、供应商评分卡、备件与维护规划,以及保险 / 贷款方报告扩。 |
| 关键押注 | 在足够多的站点里,现有 CDU、化学和维护数据,已经足以支撑一个有价值的 MVP;不必靠自研硬件才能落地。 · 由人批准的处置建议和证据包,会比自动优化更早替产品拿到预算。 · 混合供应商机房的痛点更急,也更有防守力;反而是单一 OEM 的新建站点,原厂更容易直接接管运营模型。 · 跨站点比较处置结果,最终会沉淀成真实护城河,而不是一份一次性的咨询交付物。 |
| 收入来源 | 按液冷机房收年度软件订阅费;更大的园区再按 MW 分层定价。 · 每种新拓扑或新机房收一次导入费和回路护照配置费。 · 高级横向对标、供应商评分卡和质保分析模块。 · 后期再上投运、保险、贷款方和全机群治理类报告模块。 |
|---|---|
| 价值单位 | 一个正在执行冷却液治理流程的液冷机房;价格再按 MW 和回路复杂度分层。 |
| 目标毛利率 | 70% |
| 扩张杠杆 | 从一个机房扩到同一园区、同一运营商名下的全部液冷机房。 · 等处置历史积累起来后,加卖供应商横向对标、维护规划和备件预测。 · 可靠性切口被信任后,再往同一客户卖投运和报告工作流。 |
| 北极星指标 | 已经进入正式生产、处置工作流受治理且事故结果可核验的液冷机房数量。 |
|---|---|
| 输入指标 | 滩头客户里,从合格初筛沟通到付费试点的转化率。 · 试点回路里,拥有完整厂商规则护照和基线化学档案的占比。 · 相较客户部署前基线,从告警出现到动作获批的中位时长。 · 带着可用于质保的证据包结案的事故占比。 · 付费试点转年度正式部署的转化率。 · 首个机房上线后 12 个月内,扩到第二个机房的比例。 |
| 待构建护城河 | 一套跨供应商的回路护照库,覆盖不同部件组合下的温度、压力、流量、化学和维护规则。 · 把化学特征、处置动作、供应商组合和停机结果连起来的结果数据集。 · 一套横向对标语料,能看清哪些处置步骤、哪些供应商组合、哪些运行边界,长期来看真的在减少事故。 |
| 终止标准 | 如果前 12 个合格 ICP 账户里,愿意为单机房试点付费的不到 3 个,就要重看切口,甚至停掉。 · 如果前 3 个试点既不能把“告警到动作获批”的时间砍掉至少 50%,也不能证明一次被避免的紧急处置,就先暂停扩张。 · 如果一半以上的合格采购方都坚持要把产品打包进单一 OEM 或化学服务合同里,就要改成渠道优先,或者放弃独立软件动作。 |
里程碑
- 在滩头市场里签下 2–3 个来自 GPU 云或 AI 托管数据中心运营商的付费单机房试点。
- 证明至少有 1 个试点能把“告警到动作获批”时间缩短 50%,或避免一次紧急处置。
- 至少把 2 个试点转成目标价带内的年度机房订阅。
- 把试点里最常见的 CDU、化学监测、BMS/DCIM 和工单组合做成可复制集成。
- 扩到大约 8 个已签约机房,覆盖 5–6 家运营商。
- 上线跨机房横向对标、供应商评分卡和维护规划工作流。
- 和一家 CDU 厂商或化学服务伙伴建起一条可复制渠道。
- 至少在 3 个客户账户里拿下第二机房扩张。
- 做到约 12 个已签约机房,对齐模型里的第 3 年 SOM。
- 补上投运、备件规划,以及保险 / 贷款方报告模块。
- 在初始客户群里,成为混合供应商直触式液冷环境的冷却液治理主记录系统。
flowchart LR Wedge[One hall coolant reliability wedge] --> MVP[Loop passport and action engine] MVP --> Proof[Prevented incidents and evidence] Proof --> Expansion[Fleet governance and benchmarking]
创始团队
| 角色 | 入职时间 | 理由 |
|---|---|---|
| 创始人/CEO | 第 0 个月 | 负责创始人主导销售、共创客户招募、伙伴地图,以及早期企业客户里跨职能采购方的穿透。 |
| 创始工程师 | 第 0 个月 | 搭起数据接入层、回路护照数据模型、告警逻辑、审计轨迹,以及对 CDU、BMS/DCIM 和工单系统的首批集成。 |
| 可靠性解决方案工程师 | 第 2 个月 | 把化学和质保要求翻成可部署规则,跑现场实施,并把每次事故整理成能拿去做客户证明的案例。 |
| 产品/工程负责人 | 第 6 个月 | 把试点里学到的东西产品化,做成可复制路线图,覆盖横向对标、证据工作流和多机房扩张。 |
| 生态合作负责人 | 第 9 个月 | 只在至少 2 个试点已经能被引用、直销价值叙事已经站稳之后,再去搭 OEM 和化学服务渠道。 |
实验路线图
| 阶段 | 实验 | 假设 | 成功指标 | 负责人 |
|---|---|---|---|---|
| 0–90 天 | 访谈 12 位 GPU 云和 AI 托管数据中心运营商里的 VP、总监与可靠性负责人;这些客户都在投运或扩容液冷机房。 | 最强的购买触发点,就是机房投运或混合供应商扩容,而且会有一个运营负责人单独赞助试点预算。 | 至少 8 次访谈提到正在发生的投运 / 流程触发点,且至少 5 位受访者能明确指出经济采购方。 | 创始人/CEO |
| 0–90 天 | 用现有 CDU、化学、BMS/DCIM 和工单数据,对 3 个在线或投运中的机房做遥测与工作流审计。 | 在大多数滩头站点里,MVP 可以以软件先行方式上线,不必加新仪表。 | 3 个被审计站点里,至少 2 个能仅靠现有数据源支撑回路护照、基线健康评分和动作建议。 | 创始工程师 |
| 0–90 天 | 从历史日志和维护记录出发,为一个共创客户手工交付一份回路护照和事故证据包。 | 就算还没自动化,单是证据工作流本身,也足以帮公司拿到一个付费试点拍板人。 | 至少 1 个目标账户确认,这份输出会改变它的复盘或维护流程,并愿意签试点或 LOI。 | 可靠性解决方案工程师 |
| 90–180 天 | 上线 2 个付费单机房试点,交付回路护照、告警分诊、动作建议和事故证据生成。 | 产品能在不替换客户现有 DCIM 或冷却硬件栈的前提下,把决策速度和事故质量做上去。 | 至少 2 个试点上线,且至少 1 个试点能把“告警到动作获批”时间缩短 50%,或证明一次被避免的紧急处置。 | 产品/工程负责人 |
| 90–180 天 | 用标准的按机房定价包,测试从付费试点转年度机房订阅的转化。 | 一旦试点拿出运营证明,采购方愿意为六位数年费合同买单。 | 至少 2 个试点客户进入年度合同谈判,且其中至少 1 个在前 12 个月内转正。 | 创始人/CEO |
| 180–360 天 | 围绕一次真实的机房扩容,和一家 CDU 厂商或化学服务伙伴启动联合销售。 | 只要先有直销标杆客户,伙伴就能更快放大合格商机管线,而不会反过来接管产品叙事。 | 至少 2 个合格机会来自一个可复制的伙伴渠道,且其中 1 个进入试点阶段。 | 生态合作负责人 |
风险评估
- R1冷却 OEM、化学供应商或监测创业公司,把足够多的工作流能力一起打包进去,让采购方把产品当成功能而不是品类。 — 先拿下中立的回路护照、处置证据和跨供应商横向对标;这些恰恰不是打包型点状方案天然会做好的部分。
- R2早期站点的遥测太碎、太弱,逼着公司转向重硬件部署。 — 先筛选仪表化成熟度,优先在软件先行站点上线;只有工作流价值已经被证明的地方,才通过伙伴补感知。
- R3预算权分散在运营、设施、采购和服务伙伴之间,试点审批因此拖慢。 — 只围绕明确的投运、扩容或事故触发点销售,并把试点打包给一个可问责的经济采购方。
- R4在数据集还不够深之前,误报或弱建议会先把信任打掉。 — 首版坚持人在环,把每次动作和结果都记下来,再和客户可靠性团队一起调规则,别过早承诺自动化。
- R5存量改造和更广义的液冷渗透,比预期慢,近端商机管线会被压缩。 — 先盯住正在扩容、或园区条件已经锁定的运营商;在滩头市场还没稳定转化前,不急着为相邻市场扩招。
| 风险 | 可能性 | 影响 | 缓解措施 |
|---|---|---|---|
| 冷却 OEM、化学供应商或监测创业公司,把足够多的工作流能力一起打包进去,让采购方把产品当成功能而不是品类。 | High | High | 先拿下中立的回路护照、处置证据和跨供应商横向对标;这些恰恰不是打包型点状方案天然会做好的部分。 |
| 早期站点的遥测太碎、太弱,逼着公司转向重硬件部署。 | High | High | 先筛选仪表化成熟度,优先在软件先行站点上线;只有工作流价值已经被证明的地方,才通过伙伴补感知。 |
| 预算权分散在运营、设施、采购和服务伙伴之间,试点审批因此拖慢。 | Medium | High | 只围绕明确的投运、扩容或事故触发点销售,并把试点打包给一个可问责的经济采购方。 |
| 在数据集还不够深之前,误报或弱建议会先把信任打掉。 | Medium | High | 首版坚持人在环,把每次动作和结果都记下来,再和客户可靠性团队一起调规则,别过早承诺自动化。 |
| 存量改造和更广义的液冷渗透,比预期慢,近端商机管线会被压缩。 | Medium | Medium | 先盯住正在扩容、或园区条件已经锁定的运营商;在滩头市场还没稳定转化前,不急着为相邻市场扩招。 |
| 标题 | 正在投运第二个液冷机房的 GPU 云运营商数据中心运营 VP |
|---|---|
| 画像 | 一家北美 GPU 云或 AI 托管数据中心运营商,正把第二个 2–10 MW 直触式液冷机房上线,泵、冷却液、CDU 和歧管来自多家厂商,并向外部 AI 客户销售带可用性承诺的算力。 |
| 触发点 | 新机房上线、混合供应商扩容,或最近一次污染惊魂,都在提醒团队:整个冷却液决策链上没有任何一家厂商能一把抓。 |
| 买方 | 数据中心运营 VP 或 COO |
| 初始合同 | 一个 10–14 周、单机房约 $60k–$120k 的付费试点;若试点证明处置更快、证据可用于正式生产,就冲抵到每年 $180k–$300k 的机房订阅里。 |
必须成立的条件
- 在前 10 个合格的 GPU 云或 AI 托管线索里,至少有 3 个会在发生灾难性停机之前,就愿意为单机房试点付费。
- 前 3 个试点里,至少能把“告警到动作获批”的时间砍掉 50%,或证明一次被避免的紧急冲洗 / 停机。
- 至少一半的合格试点站点,能只靠现有 CDU、化学、BMS/DCIM 和工单数据把 MVP 跑起来,不必加专有硬件。
- 只要试点证据交出来,VP 或 COO 级负责人就能在 6–9 个月周期里拍下六位数年费合同。
- OEM 和化学服务伙伴会愿意接入这层中立证据层,而不是封数据口,或坚持把整个工作流收回自己手里。
待尽调问题
- 未来 12 个月里,到底有多少目标运营商会投运第二个液冷机房,而且符合混合供应商画像?
- 今天在新型云服务商和 AI 托管运营商里,冷却液事故预算和审批权究竟归谁?
- 在线站点里,有多少已经具备足够遥测,能支持软件先行部署?
- 哪些事故真的会引出值得做成产品的质保追偿或供应商争议?
- 采购方更偏好直接签软件合同,还是通过冷却 OEM / 化学服务伙伴采购?
| 结论 | 约见 / 继续深挖 |
|---|---|
| 信心 | 切口有真实痛点,时点也对;但判断能不能成立,取决于运营负责人是否会在 OEM 打包补齐之前,就先为一层独立软件买单。 |
| 相信的理由 | 混合供应商的液冷 AI 机房已经开始承受机架级停机风险,而公开市场里还没有哪家现有厂商,真正拿下这层中立的处置与证据工作流。 |
| 怀疑的理由 | 如果采购方把这件事看成传感器、OEM 或水处理服务里的一个功能,而不是独立控制平面,这个品类就可能被迅速打包吃掉。 |
| 下一步尽调 | 先验证 2–3 个付费试点,是否能只靠现有遥测就上线,并在证明更快处置和更好的事故证据后,转成六位数的年度机房订阅。 |
财务模型
| 第 1 年收入 | $313K EBITDA $-785K · 期末现金 $-785K |
|---|---|
| 第 2 年收入 | $1.48M EBITDA $-880K · 期末现金 $-1.67M |
| 第 3 年收入 | $2.73M EBITDA $-581K · 期末现金 $-2.25M |
| 年 ARPU | $250K |
|---|---|
| 毛利率 | 72% |
| CAC | $150K 回本期 10.0 个月 |
| LTV / CAC | 10.0x 生命周期价值 $1.50M |
| 轮次 | 种子轮 · $3.0M |
|---|---|
| 跑道 | 24 个月 |
| 里程碑 | 在更大规模扩张前,先做到 5 个已签约机房、2 个年度试点转正、可复制集成,以及 1 条在线伙伴渠道。 |
模型合理性
- 收入引擎. 基线收入,来自已签约机房从 Y1 末 3 个、爬到 Q4Y2 的 8 个,再到 Y3 的 12 个;每个机房年收入约 $250K。
- 必须跑顺的地方. 这套计划必须让付费试点按时转正,并顺势拿下第二机房扩张,因为资金模型里大部分爬坡都压在 Y2。
- 模型会在哪些地方断. 如果销售周期拉到 12 个月,或部署最终变成重硬件,下行情形就会滑向更深的现金低点,并需要更大的后续融资。
- 下一轮证明点. 这一轮种子轮,目标是在大约 18 个月内做到 5 个已签约机房、2 个年度转正、可复制集成,以及 1 条在线伙伴渠道。
- 营收(线/面积)
- 期末现金(虚线)
- EBITDA(柱,灰色为亏损)
- 创始人/CEO
- 工程
- 可靠性 / 实施
- GTM / 生态合作
- G&A / 运营
| 第3年营收 | 第3年 EBITDA | 现金最低点 | 说明 | |
|---|---|---|---|---|
| 下行 | 试点转正延后,混合供应商集成长期保持高度定制,第二机房扩张也比计划更慢。 | |||
| 基准 | Y1 的 3 个付费试点机房,会在 Q4Y2 变成 8 个已签约机房,并在 Y3 做到 12 个;软件先行部署和第二机房扩张都开始可复制。 | |||
| 上行 | 付费试点转正更快,一条伙伴渠道在 Y2 就开始贡献线索,横向对标模块也把扩张速度和每机房混合收入一起抬高。 |
| 变量 | 下行 | 上行 | 现金影响 | 营收影响 |
|---|---|---|---|---|
| 销售周期 | 从需求发现到年度合同的平均周期拉长到 12 个月 | 有标杆客户后,平均周期压到 6 个月 | ||
| ARPU | 每个已签约机房的混合年收入 $225K | 每个已签约机房的混合年收入 $275K | ||
| CAC | CAC 升到 $190K,因为每单依旧需要创始人和现场实施重投入 | 靠更紧的转介绍和伙伴带来的开场,CAC 降到 $120K | ||
| 客户流失率 | 如果产品更像一次性投运工具,月流失率升到 2.0% | 若横向对标锁定强、第二机房扩张顺,月流失率降到 0.5% | ||
| 招聘节奏 | 在第二机房扩张还没可复制前,就提前招入第 4 名工程师和第 3 名可靠性岗位 | 等伙伴带来的商机管线被证明后,再延后 1 名非核心现场岗位 | ||
| 毛利率 | 部署工作始终偏定制,稳态毛利率只有 68% | 集成更早标准化,稳态毛利率到 74% |
情景
| 情景 | 第 3 年收入 | 第 3 年 EBITDA | 现金低点 | 说明 | 关键变化 |
|---|---|---|---|---|---|
| 下行 | $2.08M | $-1.04M | $-2.98M | 试点转正延后,混合供应商集成长期保持高度定制,第二机房扩张也比计划更慢。 |
|
| 基准 | $2.73M | $-581K | $-2.25M | Y1 的 3 个付费试点机房,会在 Q4Y2 变成 8 个已签约机房,并在 Y3 做到 12 个;软件先行部署和第二机房扩张都开始可复制。 |
|
| 上行 | $3.10M | $-150K | $-1.90M | 付费试点转正更快,一条伙伴渠道在 Y2 就开始贡献线索,横向对标模块也把扩张速度和每机房混合收入一起抬高。 |
|
敏感性
| 变量 | 下行情景 | 基准情景 | 上行情景 |
|---|---|---|---|
| ARPU | 每个已签约机房的混合年收入 $225K | 每个已签约机房的混合年收入 $250K | 每个已签约机房的混合年收入 $275K |
| CAC | CAC 升到 $190K,因为每单依旧需要创始人和现场实施重投入 | $150K CAC | 靠更紧的转介绍和伙伴带来的开场,CAC 降到 $120K |
| 客户流失率 | 如果产品更像一次性投运工具,月流失率升到 2.0% | 月流失率 1.0% | 若横向对标锁定强、第二机房扩张顺,月流失率降到 0.5% |
| 销售周期 | 从需求发现到年度合同的平均周期拉长到 12 个月 | 平均周期 8-9 个月 | 有标杆客户后,平均周期压到 6 个月 |
| 毛利率 | 部署工作始终偏定制,稳态毛利率只有 68% | 稳态毛利率 72% | 集成更早标准化,稳态毛利率到 74% |
| 招聘节奏 | 在第二机房扩张还没可复制前,就提前招入第 4 名工程师和第 3 名可靠性岗位 | 当前这条与里程碑挂钩的招聘爬坡 | 等伙伴带来的商机管线被证明后,再延后 1 名非核心现场岗位 |
关键假设 (24)
| ID | 名称 | 数值 | 单位 | 来源 |
|---|---|---|---|---|
| A1 | 模型启动月份 | 2026-07 | 月 | [business-plan.date 2026-06-30;模型从下一个月启动] |
| A2 | 每个已签约机房的混合年收入 | 250 | USDK ARR per hall | [business-plan.gtm.pricing $180k-$300k 年费订阅 + 导入费] [research.market.som 采用每机房约 $250k ARR] |
| A3 | 试点在收入模型里的处理方式 | 付费试点从上线起就计入已签约机房,因为试点费用会冲抵后续正式年费合同 | policy | [business-plan.gtm.pricing] [business-plan.investorMemo.firstCustomer.initialContract] |
| A4 | 第 1 年已签约机房爬坡 | M5 1 个机房;M8 2 个机房;M11 3 个机房 | customersEop | [business-plan.product.sixMonth 2-3 个付费试点] [business-plan.milestones 0-12 个月:2-3 个付费单机房试点、2 个转正] |
| A5 | 第 2 年已签约机房爬坡 | Q1Y2 4 个机房;Q2Y2 5 个机房;Q3Y2 7 个机房;Q4Y2 8 个机房 | customersEop | [business-plan.milestones 12-24 个月:约 8 个已签约机房,覆盖 5-6 家运营商] |
| A6 | 第 3 年已签约机房爬坡 | Q1Y3 9 个机房;Q2Y3 11 个机房;Q3Y3 12 个机房;Q4Y3 12 个机房 | customersEop | [business-plan.milestones 24-36 个月:约 12 个已签约机房] [research.market.som:12 个机房、每个约 $250k ARR] |
| A7 | 毛利率爬坡 | 65% Y1 / 70% Y2 / 72% Y3 | 百分比 | [business-plan.businessModel.targetGrossMarginPct 70] + 创业财务启发式:软件先行集成一旦可复用,毛利率会继续抬升 |
| A8 | 平均企业销售周期 | 从完成初筛沟通到签下年度合同,平均 8–9 个月 | 个月 | [business-plan.investorMemo.mustBeTrue 试点证据出来后 6-9 个月签年费] + 首批混合供应商基础设施交易的保守财务启发式 |
| A9 | 单位经济模型里的月度客户流失率 | 1.0 | 百分比 | 面向粘性较强、但仍处早期的企业基础设施软件的创业财务启发式;正式机房爬坡已按净值口径建模 |
| A10 | 创始人 / CEO 含税福利后现金薪酬 | 160 | USDK 每年 per FTE | [business-plan.team 创始人/CEO] + 创业财务启发式:按低于市场价的创始人现金薪酬,并含税费和福利 |
| A11 | 工程团队含税福利后现金薪酬 | 200 | USDK 每年 per FTE | [business-plan.team 创始工程师与产品/工程负责人] + 面向资深基础设施工程师的创业财务启发式 |
| A12 | 可靠性 / 实施含税福利后现金薪酬 | 175 | USDK 每年 per FTE | [business-plan.team 可靠性解决方案工程师] + 面向现场型技术可靠性人才的创业财务启发式 |
| A13 | GTM / 生态合作含税福利后现金薪酬 | 185 | USDK 每年 per FTE | [business-plan.team 生态合作负责人] + 面向早期企业合作 / AE 人才的创业财务启发式 |
| A14 | 运营 / 财务含税福利后现金薪酬 | 120 | USDK 每年 per FTE | 创业财务启发式:1 名早期运营岗覆盖财务、保险与采购支持 |
| A15 | 招聘节奏 | 创始人 M1;工程 M1/M7/M13/M28;可靠性 M3/M16/M31;GTM M10/M22;运营 M16 | hire 个月 | [business-plan.team] [business-plan.strategicChoices.sequencingRationale] [business-plan.milestones] |
| A16 | 销售与市场非薪酬支出 | 8K/月 M1-M6; 12K/月 M7-M12; 16K/月 M13-M18; 20K/月 M19-M24; 24K/月 M25-M30; 28K/月 M31-M36 | USDK 每月 | [business-plan.gtm channels and founder-led motion] + 创业财务启发式:企业基础设施销售所需的差旅、活动和伙伴拓展费用 |
| A17 | 研发工具和云支出 | 10K/月 M1-M6; 12K/月 M7-M12; 14K/月 M13-M18; 16K/月 M19-M24; 18K/月 M25-M30; 20K/月 M31-M36 | USDK 每月 | [business-plan.product MVP 与集成] [business-plan.operations 参考集成栈] [research.regulatoryTechnicalConstraints] |
| A18 | G&A 非薪酬支出 | 6K/月 M1-M6; 8K/月 M7-M12; 10K/月 M13-M18; 12K/月 M19-M24; 13K/月 M25-M30; 15K/月 M31-M36 | USDK 每月 | [business-plan.operations] + 创业财务启发式:保险、法务、会计、安全审查和管理软件 |
| A19 | 收入确认口径 | 活跃已签约机房 × 每机房每月 $20.8K 收入 | formula | [A2] + 标准 SaaS 按期确认启发式 |
| A20 | 经营模型里的期初现金 | 0 | USDK | 建模约定:资金需求放在 fundingAsk 里展示,不假设期初现金滚存 |
| A21 | 现金转化口径 | 现金流动近似按 EBITDA 计算;不假设债务、资本开支或营运资金收益 | formula | 面向轻资产软件公司的保守创业财务启发式 |
| A22 | 稳态 CAC | 150 | USDK per contracted hall | [business-plan.gtm.funnelTargets] + 模型里 late-Y2 / early-Y3 阶段的创始人主导企业销售与伙伴拓展支出 |
| A23 | 种子轮里程碑 | 到第 18 个月:5 个已签约机房、2 个年度转正、标准集成,以及 1 条在线伙伴渠道,再往更广的全机群扩张 | milestone | [business-plan.fundingAsk.useOfFundsSummary] [business-plan.product.twelveMonth] [business-plan.milestones 12-24 个月] |
| A24 | 种子轮规模 | 3.0M 种子轮,对应 24 个月目标跑道 | USDM | [business-plan.fundingAsk targetFundingRangeUsd $3-5M and runwayMonths 18] + 额外 6 个月缓冲,用来覆盖存量改造与采购拖期风险 [business-plan.risks] [research.openQuestions] |
flowchart LR CommissioningTrigger --> PaidPilot PaidPilot --> ContractedHall ContractedHall --> Revenue Revenue --> GrossProfit GrossProfit --> Cash ContractedHall --> BenchmarkingExpansion BenchmarkingExpansion --> Revenue
警示项: 模型成立的前提,是软件先行部署真的跑得通;一旦变成必须上硬件,或大量依赖实验室 / 现场服务,毛利率和资金需求都会受压。 · 收入集中度依然很高,因为 12 个机房大概率也只对应 8–10 家运营商;一单扩容推迟,就会明显拖动全年结果。 · LTV/CAC 看起来很漂亮,但客户流失率仍只是启发式假设;这个品类太新,公开市场还没有冷却液可靠性软件的留存数据。 · 本轮融资额刻意取在商业计划区间的下沿,而且假设试点都能保持付费,不会滑成免费共创项目。
主要风险
- OEM 打包. 冷却 OEM 或传感器厂商,可能会把足够多的工作流软件一起打包进去,让独立控制平面更难卖。 缓解措施: 坚持中立、先把混合机群的跨厂商集成跑通,并抢下任何单一 OEM 都很难可信管理的质保与维护决策工作流。
- 遥测碎片化. 早期客户的传感器覆盖、人工日志和维护数据可能参差不齐,自动化建议的上限会被拖住。 缓解措施: 先支持轻量 CSV 和工单导入,把人工复核的处置手册留在环里,先用事故协同证明价值,再谈完全自治。
- 液冷渗透节奏参差. 部分 AI 站点采用液冷的速度可能比预期慢,早期市场就会比模型里更窄。 缓解措施: 先盯住已经背着可用性 SLA 上线液冷机房的 GPU 云和 AI 托管运营商,再拿这些客户做案例,等品类成熟后往外扩。
证据
引用来源 (40)
- TechCrunch. Omen AI's plan to optimize data centers is all wet · https://techcrunch.com/2026/06/29/omen-ais-plan-to-optimize-data-centers-is-all-wet/
- PRNewswire. Omen AI Raises $31M Series A to Bring Continuous Fluid Intelligence to the Machines Powering the AI Economy · https://www.prnewswire.com/news-releases/omen-ai-raises-31m-series-a-to-bring-continuous-fluid-intelligence-to-the-machines-powering-the-ai-economy-302814262.html
- TrendForce. Liquid Cooling to Scale in AI Data Centers, Penetration to Surpass 30% in 2025, Says TrendForce · https://www.trendforce.com/presscenter/news/20250821-12682.html
- PR Newswire / Valuates Reports. Direct-to-Chip Cooling Market Booms as Data Centers Shift Toward Sustainable Thermal Solutions · https://www.prnewswire.com/news-releases/direct-to-chip-cooling-market-booms-as-data-centers-shift-toward-sustainable-thermal-solutions--valuates-reports-302494657.html
- Technavio. Liquid Cooling For AI Data Centers Market Growth Analysis - Size and Forecast 2026-2030 · https://www.technavio.com/report/liquid-cooling-for-ai-data-centers-market-industry-analysis
- JLL. 2026 Global Data Center Outlook · https://www.jll.com/content/dam/jllcom/en/global/documents/reports/research-reports/26-research-global-data-center-outlook-new.pdf
- CBRE. AI Necessitates New Blueprint for Digital Infrastructure · https://www.cbre.com/insights/briefs/ai-necessitates-new-blueprint-for-digital-infrastructure
- CoreWeave. AI Data Centers · https://coreweave.com/ai-data-centers
- Schneider Electric. Liquid cooling solutions for AI and high-density data centers · https://www.se.com/us/en/work/solutions/data-centers-and-networks/liquid-cooling/
- Schneider Electric. Liquid cooling challenges in AI data centers · https://www.se.com/ww/en/insights/ai-and-technology/artificial-intelligence/liquid-cooling-challenges-in-data-centers-navigating-the-future-of-cooling-efficiency/
- Lenovo Press. Lenovo Neptune Direct Water-Cooling Standards · https://lenovopress.lenovo.com/lp2018-lenovo-neptune-direct-water-cooling-standards
- NVIDIA Blog. Hotter Than a Hot Tub: The 45°C Breakthrough to Cool AI's Biggest Machines · https://blogs.nvidia.com/blog/liquid-cooling-ai-factories/
- NVIDIA. NVIDIA DSX AI Factories · https://www.nvidia.com/en-us/data-center/products/dsx/
- OCP Cooling Environments Working Group. Data Center Liquid Distribution Guidance & Reference Designs · https://ocp-all.groups.io/g/OCP-Cooling-Environments/attachment/11/3/OCP%20ACF%20Reference%20Design%20Guidance.pdf
- Uptime Institute. Resiliency considerations with direct liquid cooling · https://intelligence.uptimeinstitute.com/sites/default/files/2023-11/UI_Briefing%20Report%20117_Resiliency%20considerations%20with%20DLC.pdf
- Uptime Institute. 2025 Cooling Systems Survey [Results and Crosstab files] · https://intelligence.uptimeinstitute.com/resource/2025-cooling-systems-survey-results-and-crosstab-files
- Data Center Dynamics. ASHRAE publishes liquid cooling guidelines as chip power moves into 'uncharted territory' · https://www.datacenterdynamics.com/en/news/ashrae-publishes-liquid-cooling-guidelines-as-chip-power-moves-into-uncharted-territory/
- Ecolab. Ecolab Launches New Cooling Management Technology To Revolutionize Performance and Efficiency for Data Centers · https://www.ecolab.com/media-center/news/ecolab-launches-new-cooling-management-technology-for-data-centers
- Data Center Dynamics. Ecolab launches water monitoring solution for direct-to-chip liquid cooling · https://www.datacenterdynamics.com/en/news/ecolab-launches-water-monitoring-solution-for-direct-to-chip-liquid-cooling/
- ChemTreat. Water Treatment Solutions for Data Centers · https://www.chemtreat.com/industries/commercial-facilities/data-centers/
- Veolia. Data Center Water Treatment Solutions · https://www.watertechnologies.com/industries/data-centers
- Veolia Water Handbook. Water Handbook - Cooling System Microbiological Control · https://www.watertechnologies.com/handbook/chapter-26-microbiological-control-cooling-system
- Kurita. Cooling Water Treatment Solutions | Industrial & Commercial · https://www.kuritaamerica.com/solutions/cooling-water-treatment-solutions
- Consulting-Specifying Engineer. Best practices for water treatment in data center cooling · https://www.csemag.com/best-practices-for-water-treatment-in-data-center-cooling/
- CXP Solutions. Data Center Water Chemistry | Cooling System Treatment · https://cxp-solutions.com/guides/data-center-water-systems/
- ASHRAE Journal / NSF PAR. Accelerated Degradation Of Copper Cold Plates In Direct-to-Chip Liquid Cooling in Data Centers · https://par.nsf.gov/servlets/purl/10537808
- Uptime Institute Journal. Data center staffing — an ongoing struggle · https://journal.uptimeinstitute.com/data-center-staffing-an-ongoing-struggle/
- ITIC. Cost of Hourly Downtime Exceeds $300,000 for 90% of Firms; 41% of Enterprises Say Hourly Downtime Costs $1 Million to Over $5 Million · https://itic-corp.com/itic-2024-hourly-cost-of-downtime-report/
- Accelsius. Accelsius · https://accelsius.com/
- Data Center Dynamics. Johnson Controls and Legrand invest in liquid cooling firm Accelsius · https://www.datacenterdynamics.com/en/news/johnson-controls-and-legrand-invest-in-liquid-cooling-firm-accelsius/
- Danfoss. Optimize your data center’s thermal management · https://www.danfoss.com/en/industries/buildings-commercial/dps/data-center-liquid-cooling/coolant-distribution-units-for-data-centers/
- Johnson Controls. Johnson Controls expands thermal management offering with scalable liquid cooling solution to meet the increasing demand · https://www.johnsoncontrols.com/media-center/news/press-releases/2025/09/08/johnson-controls-expands-thermal-management-offering-with-scalable-liquid-cooling-solution-to-meet-t
- Pyxis Lab. KRYOPTIX IK-Series: Why Coolant Chemistry Monitoring Matters for AI Data Centers · https://www.pyxis-lab.com/kryoptix-ik-series-why-coolant-chemistry-monitoring-matters-for-ai-data-centers/
- Pyxis Lab. IK-1600 Series | Smart Sensor Panel | CDU Cooling · https://www.pyxis-lab.com/product/ik-1600-series-fluid-chemistry-analyzers-for-ai-critical-cdus/
- Dow. Dow Coolant Care Network · https://www.dow.com/en-us/market/mkt-electronics/sub-elec-data-center-cooling/dow-coolant-care-network.html
- Flex. Flex Expands Liquid Cooling Footprint at Equinix Co-Innovation Facility · https://investors.flex.com/news/news-details/2025/Flex-Expands-Liquid-Cooling-Footprint-at-Equinix-Co-Innovation-Facility/default.aspx
- Equinix. Equinix to Accelerate and Simplify Liquid Cooling Deployments to Power Enterprise AI Workloads · https://investor.equinix.com/news-events/press-releases/detail/1021/equinix-to-accelerate-and-simplify-liquid-cooling
- NTT DATA. NTT DATA Accelerates Global Data Center Footprint in 2024 with Bold Investments and Industry-First Innovations · https://services.global.ntt/en-US/newsroom/ntt-data-expands-global-data-centers-in-2024-with-bold-investments-and-industry-first-innovations
- NTT Global Data Centers. NTT Global Data Centers Report Reveals What It Will Take to Power the Next Wave of AI · https://services.global.ntt/en-us/newsroom/ntt-global-data-centers-report-reveals-what-it-will-take-to-power-the-next-wave-of-ai
- Flexential. Flexential Adding Fifth Atlanta-Area Data Center as Demand Accelerates Across the Southeast · https://www.prnewswire.com/news-releases/flexential-adding-fifth-atlanta-area-data-center-as-demand-accelerates-across-the-southeast-302741527.html