成本不可控
云预算通常不是硬封顶;spot/竞价会中断;GPU 价格、库存、区域和存储费用快速变化。
01 · Problem
真正的商业客户不只问“模型有没有训练出来”。他们会问预算是否失控、数据是否跨境、不同云训练结果是否可比较、模型能否部署回 Qualcomm edge,以及失败后能否回滚。
云预算通常不是硬封顶;spot/竞价会中断;GPU 价格、库存、区域和存储费用快速变化。
中国客户、海外客户、公开 demo 和企业私有数据面对不同区域、账号、付款、发票和访问约束。
不同 provider、镜像、dataset revision、split、seed、checkpoint 和代码版本会让结果不可比较。
训练 loss 下降不等于任务变好;客户需要固定 eval protocol、失败类型、回放视频和 release verdict。
云端 checkpoint 必须进入 ONNX/PT2、AI Hub/QNN、profile、inference 校验、artifact hash 和 rollback。
FinOps、采购、安全、法务和数据治理都会问预算、区域、审计、权限和责任边界。
02 · Current Alternatives Fail
TrainRouter 不替代 Kubernetes、SkyPilot、Ray、Kubeflow、HF Jobs 或云厂商;它把它们当 backend,把 robot contract、routing policy、evidence bundle 和 Qualcomm export gate 做成产品层。
负责运行容器和作业,但不理解 LeRobot dataset、observation/action schema、机器人 embodiment 和 edge target。
跨云 GPU 调度很强,但它不提供机器人训练 contract、数据权利、Qualcomm artifact receipt 和 promotion gate。
提供训练 job schema 或 pipeline,但通常停在云内资源、容器、输入输出和模型 registry。
支持复现实验和 artifact,但不会强制机器人 preflight、behavior gate、edge gate 和 rollback drill。
RunPod、Lambda、Modal、AutoDL、PAI、腾讯、华为卖算力,不负责把结果变成 edge skill release。
Viam、Formant、Foxglove 解决 fleet、teleop、数据可视化或运维,不是受控训练执行平面。
03 · Solution
TrainRouter = Robot Job Contract + Lane Policy + Budget Admission + Data Boundary + Reproducible Eval + Artifact Provenance + Qualcomm Export Gate。
04 · Why Now
CloudTwin 已经定义了 episode-to-policy release,TrainRouter 承担其中最难标准化的执行层:在明确预算和数据边界内训练,并把结果推到 Qualcomm edge 可验证门槛。
Dataset v3、HF Jobs、`lerobot-train/eval/rollout`、HIL/DAgger 和 policy zoo 给出共同语言。
海外 RunPod/Modal/Lambda/CoreWeave,国内 AutoDL/阿里/腾讯/华为,价格、库存和采购流程差异很大。
预算硬停、数据驻留、跨境审批、RBAC、审计、SIEM、provenance 和 evidence export 进入采购语言。
AI Hub、QNN/QAIRT、ONNX Runtime QNN、Profiler、Qualcomm Linux 和 QIR SDK 让 edge gate 可以产品化。
05 · Product
TrainRouter 的产品不是“发起训练”按钮,而是一条从 admission 到 edge receipt 的受控路径。
选择 train/eval/rollout/hil、dataset、policy、robot profile、target board、data class、region 和 budget。
检查 Dataset v3 schema、camera/FPS、policy I/O、data region、spot_allowed 和 checkpoint policy。
敏感数据禁用 spot/community;紧急交付走 on-demand、预留、专属或私有 runner。
生成 cost estimate、max_cost、hard_stop_policy、warning/checkpoint/stop thresholds 和 approval flow。
渲染完整 LeRobot CLI,提交 adapter,记录 job id、logs、resource metrics、checkpoint 和 recovery log。
固定 revision、split、seed 和 eval protocol;仿真、回放和真实机器人指标分开标注。
提交 Qualcomm export gate,记录 AI Hub job IDs、runtime、device、latency、memory 和 fallback。
生成 skill release package、rollback package、qualcomm_export_manifest 和 SkillCertKit 凭证。
输出 Budget/FinOps、Data Boundary、Governance/Provenance 和评委版 evidence table。
通过 SkillCertKit 后进入 SkillDock;没有 edge evidence 不可发布。
06 · Product API/Evidence
字段包括 runner、dataset revision、split/episode ids、policy checkpoint、full CLI、max cost、hard stop、spot policy、eval protocol、target device、audit sink 和 rollback requirement。
07 · Market & Business Model
TrainRouter 赚的不是纯 GPU 价差,而是受控执行、数据边界、可复现评估、edge export 和证据包的钱。
需要固定预算、低摩擦训练、比赛展示和 reproducible eval pack。
需要把 demo 变成可复现版本发布,避免云脚本、数据和边缘部署断裂。
把训练成本、数据边界、验收指标和回滚写进 4-8 周试点合同。
FinOps、安全、法务、采购需要 hard stop、approval、RBAC、region allowlist 和 SIEM audit。
海外 dev 用 Modal/RunPod/Lambda;海外企业用 CoreWeave/Lambda;中国 dev 用 AutoDL;中国企业用 PAI/腾讯/华为。
Developer Starter、Pro Lab、SI Pilot、Enterprise Private Lane 和 Governance Pack。
08 · Competition & Moat
SkyPilot 已经覆盖多云 GPU arbitrage,W&B/MLflow 已经覆盖 artifact 和 registry。TrainRouter 的差异在机器人语义、数据边界、评测门禁和 Qualcomm edge receipt。
09 · Why Qualcomm
TrainRouter 把“云训练完成”变成 Qualcomm 关心的交付物:checkpoint、ONNX/PT2、量化日志、AI Hub job IDs、目标设备、runtime、NPU placement、latency、memory、fallback、数值差异、artifact hash 和 rollback package。
开发者不是只说“我训练好了”,而是带着 RB3/QCS6490、QCS8550、IQ 系列的可审计证据来关闭性能和算子问题。
compile、profile、inference 校验、download receipt、optrace/QHAS bottleneck 和 artifact hash 进入 release record。
QNN context binary 是 SoC-specific;proxy 分数不能当真实硬件保证,profile 必须标注目标设备和运行时。
AI Hub quota、Device Cloud/真实设备、QNN soc_model 映射、QNN EP 矩阵、QIR 样例、Profiler 模板和 Robotics Hub review。
10 · Demo & Ask
比赛 demo 从 `robot_job_contract.yaml` 开始,到 Qualcomm export receipt 和 rollback package 结束。中间每一步都要让评委看到商业客户会付钱的控制点。
选择 dataset revision、policy、target profile、lane、budget、spot policy 和 eval gate。
展示 schema、split hash、data class、region allowlist、estimated cost 和 hard stop。
展示 provider 选择理由、fallback、checkpoint policy、cost burn 和 interruption recovery。
展示 fixed eval report、failure tags、intervention rate、baseline delta、replay videos 和 verdict。
展示 AI Hub job IDs、runtime target、profile metrics、op fallback、artifact hash 和 SkillDock 状态。
TrainRouter 的一句话:把“租 GPU 训练模型”变成“按预算发布一个能在 Qualcomm 机器人上验证的技能版本”。
Claim Boundaries
TrainRouter 不声称获得 Qualcomm 官方认证,不自动满足 PIPL/GDPR/EU AI Act,不保证云成本永不超支,不保证 spot 稳定,不承诺任意模型无损编译到 QNN,也不把 AI Hub profile latency 当最终机器人 app latency。所有指标必须标注 simulated、replay-eval、Device Cloud 或 measured-on-hardware,并附日期、板卡、SDK/runtime、模型版本和 dataset hash。