ComputeLoop 智算异常闭环台

Pitch 72 · AI Factory Exception Closure

AI 工厂不缺 GPU,缺的是把每次异常关成可验证恢复。

ComputeLoop 是智算中心异常闭环台,把 GPU/NPU、RoCE 网络、调度队列、液冷、漏液、电力、PUE、机器人巡检、工单和 SLA 影响打成同一个异常 ID:少停训、快定位、控 PUE、保 SLA、可上报。

01 · Problem

智算中心已经有很多监控,却没有一个系统负责“恢复已被验证”。

一次推理 p99 飙升或训练中断,可能同时表现为 GPU 掉卡、RoCE 重传、存储抖动、CDU 流量下降、PDU 告警、漏液传感器报警、热像异常、调度队列堆积和客户 SLA 风险。DCIM 看机电,AIOps 看指标,SRE 看作业,设施团队看能耗,客户成功看赔付。大家都看见了一部分,但没人拥有完整闭环。

告警很多

DCIM、BMS、EPMS、Prometheus、Grafana、ServiceNow、CDU 和 GPU telemetry 都会响。

结论很慢

设施、平台、网络、硬件、客户成功和供应商之间需要人工拼图。

动作很散

迁移任务、隔离节点、工单、巡检、复拍、降载和上报经常不是同一条时间线。

复盘很贵

事故后才补截图、日志、工单、温度曲线和责任结论,训练数据也随之丢失。

02 · Why We Solve It

稳定算力已经是收入问题、能源问题和监管问题。

新增一批 GPU 很贵,稳定已有算力更便宜。对智算运营方来说,一次异常不只是设备告警,它会影响可售 GPU 小时、客户续约、训练进度、推理 SLA、能源审查、液冷安全和全国算力监测调度上报。

停训停推理

单点组件故障可能拖垮训练任务,推理延迟会直接进入客户 SLA。

液冷新风险

高密机柜把热、流量、压力、漏液和维护流程变成新的运营变量。

算电协同

算力、用电、绿电、PUE、需求响应和容量降额需要同一证据链。

客户信任

客户要看到事故时间线、影响范围、恢复证据和复发预防,而不是一句“已处理”。

上报审计

国资、运营商、园区和行业云需要可上报、可审计、可追责的运行记录。

03 · Why Now

AI 工厂正在从“建得快”转向“用得稳、用得绿、用得满”。

2026 年的智算竞争不是普通云计算扩容。高密液冷、千卡万卡集群、推理 SLA、缺电缺网、绿电/PUE 约束和政府算力调度平台同时到来。既有 DCIM 和 AIOps 能看见局部,客户缺的是跨 GPU、网络、液冷、电力、作业和工单的异常闭环。

$400B+ IEA 口径:五大科技公司 2025 年资本开支超过 4000 亿美元,AI 工厂容量在 18 个月内快速扩张。
~950TWh IEA 预计全球数据中心用电到 2030 年接近 950 TWh,AI 类数据中心增长更快。
188万PFLOPS 国家数据局 2026 年披露,全国智能算力规模已达 188 万 PFLOPS FP16。
1.5 PUE 中国绿色低碳数据中心行动计划要求平均 PUE、上架率、绿电和节能改造成为硬指标。

04 · Insight

AI 数据中心的最小商业单位不是告警,而是“已验证恢复事件”。

监控工具卖的是看见,闭环系统卖的是恢复。ComputeLoop 把一次异常从发现、合并、影响评估、责任分配、SOP、巡检证据、人工批准、恢复验证到复盘标签连接起来。每一次关闭,都是下一次更快恢复的数据。

Alert-to-Impact

把一组告警压成一个影响图:哪些机柜、哪些卡、哪些作业、哪些客户受影响。

Impact-to-Action

给出可审批动作:迁移任务、隔离节点、开工单、派机器人、通知设施。

Action-to-Proof

用 p99、利用率、失败率、热像、漏液、流量、PUE 和工单状态证明恢复。

05 · Solution

ComputeLoop 不替代 DCIM、AIOps 或液冷控制,它关闭它们之间的运营断点。

ComputeLoop 是 AI 工厂的异常闭环层。它只读接入 DCIM/BMS/EPMS、CDU、漏液、PDU/UPS、GPU telemetry、K8s/Slurm、Prometheus/Grafana、ServiceNow/CMMS 和机器人巡检,生成一个跨 IT 与设施的异常 ID、影响图、处置卡和验证证据包。

  • Detect:接入作业、节点、GPU、网络、存储、PDU、UPS、CDU、漏液、热像、工单和机器人。
  • Correlate:按站点、房间、机柜、节点、作业、客户、冷却环路、电力链路和时间窗口合并。
  • Dispatch:给出 owner、SOP/MOP/EOP、审批路径、风险等级、证据要求和回滚条件。
  • Verify:用业务指标、设施指标、机器人复拍、人工验收和工单状态证明恢复。
  • Learn:把误报、有效动作、复发模式和最终 verdict 写回事故图谱与训练数据。
智算中心异常闭环平台,AI 机柜、液冷管路、巡检机器人、热像、漏液、气流、功耗和证据时间线

06 · First Product

第一版只打高密液冷 pod 的跨层异常闭环。

最佳切口不是超大云厂自研系统,也不是小机房。首单应选 500-5000 卡、正在上液冷的企业私有智算、地方智算中心、neocloud、运营商云池或行业推理平台。规模足够痛,流程还没有完全固化,闭环价值能在 90 天内被量化。

GPU / Job

掉卡、降频、作业失败、队列堆积、p99 飙升和客户 SLA 风险。

Liquid Cooling

CDU、流量、压差、温差、漏液、冷却容量和阀组/支路异常。

Power Chain

PDU、UPS、电池、瞬时负载、容量降额和算电协同响应证据。

Robot Evidence

机器人热像、漏液托盘、气流、指示灯、线缆和维护标签复拍。

Closure

工单、SOP、人工批准、复核指标、审计导出和复盘训练标签。

07 · Market

中国版本服务东数西算和算电协同,海外版本服务 AI factory uptime。

同一个内核,两套话语。中国客户买安全可靠、绿色低碳、算力有效性、国产适配、全国一体化算力监测调度和可上报台账。海外客户买 AI factory reliability、liquid cooling assurance、capacity recovery、SLA evidence 和 audit-ready incident reports。

中国智算版本

卖给运营商云、地方数据集团、国资智算中心、园区算力平台、行业云和 EPC/O&M 集成商。采购语言是算力互联纳管、监测调度、运营、算电协同、告警收敛、自动诊断、液冷漏液检测、PUE 可视可管可控、综合运维健康度评估。

海外 AI Factory 版本

卖给 colo、neocloud、企业 AI 基础设施、主权 AI、推理服务商和高密改造项目。采购语言是 uptime、capacity forecasting、energy performance、power availability、liquid-cooling risk、incident evidence、insurance and compliance reporting。

08 · Business Model

按站点、MW、机柜、液冷域和闭环模块收费。

ComputeLoop 的商业理由不是“AI 运维很酷”,而是“每一次恢复都更快、更可证明、更少影响可售算力”。首单用影子模式和辅助闭环证明 ROI,再扩展到多站点、液冷安全、SLA 证据、能耗异常和托管闭环。

中国试点

90 天,人民币 30万-80万,覆盖 1 个 pod、20-60 个高密柜、3-5 类异常。

中国生产

每站人民币 80万-300万/年;多站运营版 500万-2000万/年;集成与驻场另计。

海外试点

75k-200k 美元,覆盖 1 个 AI hall/pod,重点验证液冷、SLA、工单和事故证据。

海外生产

按站点 250k-1M 美元/年,或按 MW/机柜收费,附加托管闭环和成功费。

09 · ROI

试点验收只看能不能减少“不可售算力小时”和事故复盘成本。

年化收益 = 训练/推理中断减少 + MTTR 缩短 + 可售 GPU 小时恢复 + 容量降额减少 + 能耗异常小时减少 + 人工巡检和远程手工时减少 + SLA 赔付和客户流失风险下降。首年费用必须低于经验证收益的 15%-25%,目标 12 个月内回本。

告警压缩

P1/P2 异常的重复告警下降 30%,每个事件有唯一异常 ID 和影响图。

响应时间

MTTA 下降 30%-50%,P1/P2 MTTR 下降 10%-20%。

证据完整率

90%+ 关闭事件包含指标、工单、责任人、时间线、复拍和验证结果。

算力恢复

统计可售 GPU 小时、容量降额、作业失败率和客户 SLA 风险变化。

能耗异常

跟踪 PUE 漂移、异常能耗小时、液冷支路异常和节能改造证据。

10 · Go-To-Market

用“液冷安全 + SLA 保障 + 算电协同上报”进入,而不是用泛 AIOps 进入。

中国从运营商、地方国资数据集团、智算中心 EPC/O&M、液冷 OEM、动环/DCIM 厂商和能源服务公司进入。海外从 colo/neocloud、AI infrastructure operators、液冷改造项目、EAM/ITSM 伙伴和机器人巡检厂商进入。

先影子模式

不接管真实配电、制冷、消防或调度,只读接入、告警收敛、影响图和证据包。

先高密液冷区

液冷、漏液、热像、功率和 GPU 降频的业务影响最容易讲清楚。

先对接工单

ServiceNow、Maximo、CMMS、钉钉/企微、ITSM 和值班系统是第一批连接器。

再多站复制

从一个 pod 的闭环率扩到站点、园区、多城算力网络和算电协同报送。

11 · Competition

DCIM、AIOps、液冷厂商和机器人都重要,但它们没有共同拥有异常闭环。

Schneider、Vertiv、Eaton、Johnson Controls、Sunbird、Nlyte、Device42、ServiceNow、Datadog、Prometheus/Grafana、CoolIT、Submer、LiquidStack、EkkoSense、ANYbotics、Boston Dynamics 和超大云厂自研系统都触达一部分问题。ComputeLoop 的位置是它们之上的跨系统异常闭环。

DCIM / 动环

擅长设施、资产、容量和机电监控,但通常不拥有 GPU 作业和客户 SLA 影响。

AIOps / ITSM

擅长告警关联和派单,但对液冷、功率链路、机柜物理证据和设施 SOP 不够深。

液冷 / 传感器

擅长局部检测和控制,但不天然连接客户、作业、工单、复盘和多厂商责任。

ComputeLoop

统一异常 ID、影响图、审批 runbook、机器人证据、验证指标、审计导出和训练标签。

12 · Moat

护城河是客户自己的 AI 工厂事故图谱。

上线越久,ComputeLoop 越懂这个站点的机柜命名、GPU 批次、液冷支路、PDU/UPS 链路、调度队列、客户 SLA、SOP、供应商责任、误报模式和有效动作。这个闭环数据不是公开数据集,也不是通用 DCIM 能自动拥有的资产。

Operations Graph

site、room、rack、server、GPU、job、power chain、cooling loop、owner、SLA。

Runbook 库

SOP/MOP/EOP、审批策略、回滚条件、验证指标和人工 verdict 沉淀成动作资产。

Evidence Pack

热像、漏液、rosbag、日志、工单、时间线、模型版本和人工结论可回放。

Local Trust

私有化、数据驻留、权限、日志、国产适配、等保和审计要求带来真实粘性。

13 · Architecture

边缘看机柜,闭环引擎看影响,人工批准关键动作。

工程原则是只读、隔离、人审、本地优先和可禁用执行入口。所有真实配电、制冷、消防和调度动作仍由合格人员与既有系统完成;ComputeLoop 提供关联、建议、证据、复核、报表和训练数据。

  • Signal Layer:metrics/logs/events/traces、K8s/Slurm、BMC、PDU、UPS、CDU、漏液、热像、机器人。
  • Impact Graph:连接作业、GPU、机柜、冷却环路、电力链路、客户、工单和 SLA。
  • Closure Engine:告警压缩、probable cause、runbook、审批、工单、巡检、验证和复盘。
  • Edge Evidence:Qualcomm edge 上做热斑、漏液、气流、机柜识别和证据打包。
  • Training Loop:LeRobotDataset 记录机器人巡检图像、状态、动作、人工 verdict 和最终标签。
智算中心异常闭环架构,站点边缘、AI 机柜、液冷、机器人巡检、影响图、runbook 和证据包

14 · Demo

比赛样机是低压 AI rack twin,演示闭环,不演示真实机房控制。

桌面样机只使用 5V/12V 限流电源、保险丝、物理急停、透明护罩、3-5 个假加速卡 sled、低压泵、密封透明管路、漏液托盘、风扇、LED 假负载、温度/流量/电流传感器和巡检小车。AI 可以建议,确定性 safety supervisor 才能执行演示动作。

Baseline

小车巡检 rack mockup,采集 RGB、热像、流量、漏液、电流、风扇和位姿。

Thermal / Flow

模拟风扇下降、流量受限或轻微假负载升温,边缘模型给出风险候选。

Leak Trip

湿润漏液垫后确定性 supervisor 立即切断泵和假负载,AI 不可覆盖。

Evidence

ROS 2 topics/actions、timeline、media、rosbag2、decision 和 evidence hash。

Export

导出 LeRobot episode、QNN 候选模型结果、人工 verdict 和复盘报告。

15 · Why Qualcomm

Qualcomm 正在进入 AI 数据中心,ComputeLoop 把高能效推理变成可运营的 AI 工厂。

Qualcomm AI200/AI250 叙事强调 rack-scale inference、能效、tokens/watt、液冷和数据中心 TCO。ComputeLoop 给这个叙事补上运营层:边缘视觉、机器人巡检、事故图谱、证据闭环和可验证恢复,让高能效硬件不只是跑得快,也能被客户信任地运维。

Edge AI Evidence

热斑、漏液、气流、机柜识别、指示灯和巡检证据适合站端本地推理。

AI Hub / QNN

把传感时序模型、MobileNet/UNet 类视觉模型编译和 profile 到 Qualcomm 目标设备。

AI200 Context

使用低压桌面样机表达 rack-scale inference 的运维闭环,绝不电气模拟真实 AI200 机柜。

Robot Flywheel

巡检失败、人工干预、最终 verdict 和恢复结果持续进入 LeRobot 数据集。

16 · Ask

请支持 ComputeLoop 成为“AI 工厂异常闭环 + 边缘机器人”的 Qualcomm 参考样机。

我们需要把低压桌面样机推到可信的行业方案:边缘开发板、AI Hub/QNN 评测、数据中心导师、液冷/机房集成伙伴和 2-3 个设计客户。

开发板与模型

Qualcomm edge 开发板、AI Hub/QNN profiling、视觉/热像/时序多传感模型建议。

联合 Rack Twin

1 个低压 rack twin,覆盖热、漏、流量、功耗、机器人和证据闭环。

设计客户

2-3 个智算中心、neocloud、液冷 pod 或企业私有算力平台访谈/试点。

生态目录

进入 Qualcomm AI infrastructure 和 edge robotics 伙伴方案叙事。

17 · Claims & Sources

把事实、试点指标和安全边界分开说。

ComputeLoop 主张低压桌面样机、只读系统集成、人审 runbook、机器人证据、LeRobot 数据导出和 Qualcomm edge/QNN 候选路径。它不主张自动控制真实配电、制冷、消防或安全系统,不替代 DCIM/BMS/消防报警/漏水检测,不承诺零误报、零停机或认证合规。

一句话 pitch:ComputeLoop 把智算中心异常从“报警很多、结论很慢”推进到“影响清楚、动作明确、恢复可验证、结果可上报”。