告警很多
DCIM、BMS、EPMS、Prometheus、Grafana、ServiceNow、CDU 和 GPU telemetry 都会响。
Pitch 72 · AI Factory Exception Closure
ComputeLoop 是智算中心异常闭环台,把 GPU/NPU、RoCE 网络、调度队列、液冷、漏液、电力、PUE、机器人巡检、工单和 SLA 影响打成同一个异常 ID:少停训、快定位、控 PUE、保 SLA、可上报。
01 · Problem
一次推理 p99 飙升或训练中断,可能同时表现为 GPU 掉卡、RoCE 重传、存储抖动、CDU 流量下降、PDU 告警、漏液传感器报警、热像异常、调度队列堆积和客户 SLA 风险。DCIM 看机电,AIOps 看指标,SRE 看作业,设施团队看能耗,客户成功看赔付。大家都看见了一部分,但没人拥有完整闭环。
DCIM、BMS、EPMS、Prometheus、Grafana、ServiceNow、CDU 和 GPU telemetry 都会响。
设施、平台、网络、硬件、客户成功和供应商之间需要人工拼图。
迁移任务、隔离节点、工单、巡检、复拍、降载和上报经常不是同一条时间线。
事故后才补截图、日志、工单、温度曲线和责任结论,训练数据也随之丢失。
02 · Why We Solve It
新增一批 GPU 很贵,稳定已有算力更便宜。对智算运营方来说,一次异常不只是设备告警,它会影响可售 GPU 小时、客户续约、训练进度、推理 SLA、能源审查、液冷安全和全国算力监测调度上报。
单点组件故障可能拖垮训练任务,推理延迟会直接进入客户 SLA。
高密机柜把热、流量、压力、漏液和维护流程变成新的运营变量。
算力、用电、绿电、PUE、需求响应和容量降额需要同一证据链。
客户要看到事故时间线、影响范围、恢复证据和复发预防,而不是一句“已处理”。
国资、运营商、园区和行业云需要可上报、可审计、可追责的运行记录。
03 · Why Now
2026 年的智算竞争不是普通云计算扩容。高密液冷、千卡万卡集群、推理 SLA、缺电缺网、绿电/PUE 约束和政府算力调度平台同时到来。既有 DCIM 和 AIOps 能看见局部,客户缺的是跨 GPU、网络、液冷、电力、作业和工单的异常闭环。
04 · Insight
监控工具卖的是看见,闭环系统卖的是恢复。ComputeLoop 把一次异常从发现、合并、影响评估、责任分配、SOP、巡检证据、人工批准、恢复验证到复盘标签连接起来。每一次关闭,都是下一次更快恢复的数据。
把一组告警压成一个影响图:哪些机柜、哪些卡、哪些作业、哪些客户受影响。
给出可审批动作:迁移任务、隔离节点、开工单、派机器人、通知设施。
用 p99、利用率、失败率、热像、漏液、流量、PUE 和工单状态证明恢复。
05 · Solution
ComputeLoop 是 AI 工厂的异常闭环层。它只读接入 DCIM/BMS/EPMS、CDU、漏液、PDU/UPS、GPU telemetry、K8s/Slurm、Prometheus/Grafana、ServiceNow/CMMS 和机器人巡检,生成一个跨 IT 与设施的异常 ID、影响图、处置卡和验证证据包。
06 · First Product
最佳切口不是超大云厂自研系统,也不是小机房。首单应选 500-5000 卡、正在上液冷的企业私有智算、地方智算中心、neocloud、运营商云池或行业推理平台。规模足够痛,流程还没有完全固化,闭环价值能在 90 天内被量化。
掉卡、降频、作业失败、队列堆积、p99 飙升和客户 SLA 风险。
CDU、流量、压差、温差、漏液、冷却容量和阀组/支路异常。
PDU、UPS、电池、瞬时负载、容量降额和算电协同响应证据。
机器人热像、漏液托盘、气流、指示灯、线缆和维护标签复拍。
工单、SOP、人工批准、复核指标、审计导出和复盘训练标签。
07 · Market
同一个内核,两套话语。中国客户买安全可靠、绿色低碳、算力有效性、国产适配、全国一体化算力监测调度和可上报台账。海外客户买 AI factory reliability、liquid cooling assurance、capacity recovery、SLA evidence 和 audit-ready incident reports。
卖给运营商云、地方数据集团、国资智算中心、园区算力平台、行业云和 EPC/O&M 集成商。采购语言是算力互联纳管、监测调度、运营、算电协同、告警收敛、自动诊断、液冷漏液检测、PUE 可视可管可控、综合运维健康度评估。
卖给 colo、neocloud、企业 AI 基础设施、主权 AI、推理服务商和高密改造项目。采购语言是 uptime、capacity forecasting、energy performance、power availability、liquid-cooling risk、incident evidence、insurance and compliance reporting。
08 · Business Model
ComputeLoop 的商业理由不是“AI 运维很酷”,而是“每一次恢复都更快、更可证明、更少影响可售算力”。首单用影子模式和辅助闭环证明 ROI,再扩展到多站点、液冷安全、SLA 证据、能耗异常和托管闭环。
90 天,人民币 30万-80万,覆盖 1 个 pod、20-60 个高密柜、3-5 类异常。
每站人民币 80万-300万/年;多站运营版 500万-2000万/年;集成与驻场另计。
75k-200k 美元,覆盖 1 个 AI hall/pod,重点验证液冷、SLA、工单和事故证据。
按站点 250k-1M 美元/年,或按 MW/机柜收费,附加托管闭环和成功费。
09 · ROI
年化收益 = 训练/推理中断减少 + MTTR 缩短 + 可售 GPU 小时恢复 + 容量降额减少 + 能耗异常小时减少 + 人工巡检和远程手工时减少 + SLA 赔付和客户流失风险下降。首年费用必须低于经验证收益的 15%-25%,目标 12 个月内回本。
P1/P2 异常的重复告警下降 30%,每个事件有唯一异常 ID 和影响图。
MTTA 下降 30%-50%,P1/P2 MTTR 下降 10%-20%。
90%+ 关闭事件包含指标、工单、责任人、时间线、复拍和验证结果。
统计可售 GPU 小时、容量降额、作业失败率和客户 SLA 风险变化。
跟踪 PUE 漂移、异常能耗小时、液冷支路异常和节能改造证据。
10 · Go-To-Market
中国从运营商、地方国资数据集团、智算中心 EPC/O&M、液冷 OEM、动环/DCIM 厂商和能源服务公司进入。海外从 colo/neocloud、AI infrastructure operators、液冷改造项目、EAM/ITSM 伙伴和机器人巡检厂商进入。
不接管真实配电、制冷、消防或调度,只读接入、告警收敛、影响图和证据包。
液冷、漏液、热像、功率和 GPU 降频的业务影响最容易讲清楚。
ServiceNow、Maximo、CMMS、钉钉/企微、ITSM 和值班系统是第一批连接器。
从一个 pod 的闭环率扩到站点、园区、多城算力网络和算电协同报送。
11 · Competition
Schneider、Vertiv、Eaton、Johnson Controls、Sunbird、Nlyte、Device42、ServiceNow、Datadog、Prometheus/Grafana、CoolIT、Submer、LiquidStack、EkkoSense、ANYbotics、Boston Dynamics 和超大云厂自研系统都触达一部分问题。ComputeLoop 的位置是它们之上的跨系统异常闭环。
擅长设施、资产、容量和机电监控,但通常不拥有 GPU 作业和客户 SLA 影响。
擅长告警关联和派单,但对液冷、功率链路、机柜物理证据和设施 SOP 不够深。
擅长局部检测和控制,但不天然连接客户、作业、工单、复盘和多厂商责任。
统一异常 ID、影响图、审批 runbook、机器人证据、验证指标、审计导出和训练标签。
12 · Moat
上线越久,ComputeLoop 越懂这个站点的机柜命名、GPU 批次、液冷支路、PDU/UPS 链路、调度队列、客户 SLA、SOP、供应商责任、误报模式和有效动作。这个闭环数据不是公开数据集,也不是通用 DCIM 能自动拥有的资产。
site、room、rack、server、GPU、job、power chain、cooling loop、owner、SLA。
SOP/MOP/EOP、审批策略、回滚条件、验证指标和人工 verdict 沉淀成动作资产。
热像、漏液、rosbag、日志、工单、时间线、模型版本和人工结论可回放。
私有化、数据驻留、权限、日志、国产适配、等保和审计要求带来真实粘性。
13 · Architecture
工程原则是只读、隔离、人审、本地优先和可禁用执行入口。所有真实配电、制冷、消防和调度动作仍由合格人员与既有系统完成;ComputeLoop 提供关联、建议、证据、复核、报表和训练数据。
14 · Demo
桌面样机只使用 5V/12V 限流电源、保险丝、物理急停、透明护罩、3-5 个假加速卡 sled、低压泵、密封透明管路、漏液托盘、风扇、LED 假负载、温度/流量/电流传感器和巡检小车。AI 可以建议,确定性 safety supervisor 才能执行演示动作。
小车巡检 rack mockup,采集 RGB、热像、流量、漏液、电流、风扇和位姿。
模拟风扇下降、流量受限或轻微假负载升温,边缘模型给出风险候选。
湿润漏液垫后确定性 supervisor 立即切断泵和假负载,AI 不可覆盖。
ROS 2 topics/actions、timeline、media、rosbag2、decision 和 evidence hash。
导出 LeRobot episode、QNN 候选模型结果、人工 verdict 和复盘报告。
15 · Why Qualcomm
Qualcomm AI200/AI250 叙事强调 rack-scale inference、能效、tokens/watt、液冷和数据中心 TCO。ComputeLoop 给这个叙事补上运营层:边缘视觉、机器人巡检、事故图谱、证据闭环和可验证恢复,让高能效硬件不只是跑得快,也能被客户信任地运维。
热斑、漏液、气流、机柜识别、指示灯和巡检证据适合站端本地推理。
把传感时序模型、MobileNet/UNet 类视觉模型编译和 profile 到 Qualcomm 目标设备。
使用低压桌面样机表达 rack-scale inference 的运维闭环,绝不电气模拟真实 AI200 机柜。
巡检失败、人工干预、最终 verdict 和恢复结果持续进入 LeRobot 数据集。
16 · Ask
我们需要把低压桌面样机推到可信的行业方案:边缘开发板、AI Hub/QNN 评测、数据中心导师、液冷/机房集成伙伴和 2-3 个设计客户。
Qualcomm edge 开发板、AI Hub/QNN profiling、视觉/热像/时序多传感模型建议。
1 个低压 rack twin,覆盖热、漏、流量、功耗、机器人和证据闭环。
2-3 个智算中心、neocloud、液冷 pod 或企业私有算力平台访谈/试点。
进入 Qualcomm AI infrastructure 和 edge robotics 伙伴方案叙事。
17 · Claims & Sources
ComputeLoop 主张低压桌面样机、只读系统集成、人审 runbook、机器人证据、LeRobot 数据导出和 Qualcomm edge/QNN 候选路径。它不主张自动控制真实配电、制冷、消防或安全系统,不替代 DCIM/BMS/消防报警/漏水检测,不承诺零误报、零停机或认证合规。
一句话 pitch:ComputeLoop 把智算中心异常从“报警很多、结论很慢”推进到“影响清楚、动作明确、恢复可验证、结果可上报”。