TrainRouter

Pitch 25 · Controlled Robot Training Execution Plane

TrainRouter

LeRobot CloudTwin 背后的受控机器人训练执行平面:把一份不可变 robot job contract 路由到中国云、海外云或私有 lane,并强制执行预算 admission、数据边界、checkpoint 恢复、固定评测和 Qualcomm edge export gate。

01 · Problem

机器人团队能训练一次模型,但很难把训练变成交付。

真正的商业客户不只问“模型有没有训练出来”。他们会问预算是否失控、数据是否跨境、不同云训练结果是否可比较、模型能否部署回 Qualcomm edge,以及失败后能否回滚。

成本不可控

云预算通常不是硬封顶;spot/竞价会中断;GPU 价格、库存、区域和存储费用快速变化。

数据边界不可见

中国客户、海外客户、公开 demo 和企业私有数据面对不同区域、账号、付款、发票和访问约束。

训练不可复现

不同 provider、镜像、dataset revision、split、seed、checkpoint 和代码版本会让结果不可比较。

评测不可采购

训练 loss 下降不等于任务变好;客户需要固定 eval protocol、失败类型、回放视频和 release verdict。

边缘导出断裂

云端 checkpoint 必须进入 ONNX/PT2、AI Hub/QNN、profile、inference 校验、artifact hash 和 rollback。

买方不止 ML 团队

FinOps、采购、安全、法务和数据治理都会问预算、区域、审计、权限和责任边界。

02 · Current Alternatives Fail

现有工具强在运行任务,弱在机器人训练交付。

TrainRouter 不替代 Kubernetes、SkyPilot、Ray、Kubeflow、HF Jobs 或云厂商;它把它们当 backend,把 robot contract、routing policy、evidence bundle 和 Qualcomm export gate 做成产品层。

Kubernetes / Ray

负责运行容器和作业,但不理解 LeRobot dataset、observation/action schema、机器人 embodiment 和 edge target。

SkyPilot

跨云 GPU 调度很强,但它不提供机器人训练 contract、数据权利、Qualcomm artifact receipt 和 promotion gate。

Kubeflow / SageMaker

提供训练 job schema 或 pipeline,但通常停在云内资源、容器、输入输出和模型 registry。

W&B / MLflow / HF Jobs

支持复现实验和 artifact,但不会强制机器人 preflight、behavior gate、edge gate 和 rollback drill。

GPU Providers

RunPod、Lambda、Modal、AutoDL、PAI、腾讯、华为卖算力,不负责把结果变成 edge skill release。

RobotOps Tools

Viam、Formant、Foxglove 解决 fleet、teleop、数据可视化或运维,不是受控训练执行平面。

03 · Solution

把通用云 runner 变成机器人训练供应链。

TrainRouter = Robot Job Contract + Lane Policy + Budget Admission + Data Boundary + Reproducible Eval + Artifact Provenance + Qualcomm Export Gate。

  • Contract:写入 kind、dataset revision、policy、robot profile、budget、data class、region、eval protocol 和 edge target。
  • Route:按 China / Overseas / Private lane 选择 AutoDL、PAI、腾讯、华为、RunPod、Lambda、Modal、CoreWeave 或 BYOC。
  • Evaluate:固定 eval gate,输出 success、failure tags、intervention rate、replay evidence、baseline delta 和 verdict。
  • Export:返回 Qualcomm compile/profile/inference/download receipt、runtime evidence、artifact hash 和 rollback package。
中国云和海外云 GPU 训练路由及 Qualcomm 边缘部署图

04 · Why Now

LeRobot、双云 GPU、企业治理和 Qualcomm edge gate 同时成熟。

CloudTwin 已经定义了 episode-to-policy release,TrainRouter 承担其中最难标准化的执行层:在明确预算和数据边界内训练,并把结果推到 Qualcomm edge 可验证门槛。

LeRobot 标准化

Dataset v3、HF Jobs、`lerobot-train/eval/rollout`、HIL/DAgger 和 policy zoo 给出共同语言。

双云现实存在

海外 RunPod/Modal/Lambda/CoreWeave,国内 AutoDL/阿里/腾讯/华为,价格、库存和采购流程差异很大。

企业要受控执行

预算硬停、数据驻留、跨境审批、RBAC、审计、SIEM、provenance 和 evidence export 进入采购语言。

Qualcomm 可验证

AI Hub、QNN/QAIRT、ONNX Runtime QNN、Profiler、Qualcomm Linux 和 QIR SDK 让 edge gate 可以产品化。

05 · Product

用户看到的是训练订单和验收单,不是云厂商控制台。

TrainRouter 的产品不是“发起训练”按钮,而是一条从 admission 到 edge receipt 的受控路径。

Contract

选择 train/eval/rollout/hil、dataset、policy、robot profile、target board、data class、region 和 budget。

Preflight

检查 Dataset v3 schema、camera/FPS、policy I/O、data region、spot_allowed 和 checkpoint policy。

Route

敏感数据禁用 spot/community;紧急交付走 on-demand、预留、专属或私有 runner。

Guard

生成 cost estimate、max_cost、hard_stop_policy、warning/checkpoint/stop thresholds 和 approval flow。

Execute

渲染完整 LeRobot CLI,提交 adapter,记录 job id、logs、resource metrics、checkpoint 和 recovery log。

Evaluate

固定 revision、split、seed 和 eval protocol;仿真、回放和真实机器人指标分开标注。

Export

提交 Qualcomm export gate,记录 AI Hub job IDs、runtime、device、latency、memory 和 fallback。

Package

生成 skill release package、rollback package、qualcomm_export_manifest 和 SkillCertKit 凭证。

Audit

输出 Budget/FinOps、Data Boundary、Governance/Provenance 和评委版 evidence table。

Publish

通过 SkillCertKit 后进入 SkillDock;没有 edge evidence 不可发布。

06 · Product API/Evidence

不可变 robot job contract 是核心资产。

字段包括 runner、dataset revision、split/episode ids、policy checkpoint、full CLI、max cost、hard stop、spot policy、eval protocol、target device、audit sink 和 rollback requirement。

  • Job Evidence:rendered command、job id/url、status、logs、resource metrics、cost estimate vs actual。
  • Training Evidence:dataset commit、LeRobot version、container digest、seed、train_config、checkpoint hash。
  • Eval Evidence:eval_info、rollout videos、failure/intervention ids、gate verdict、human approval。
  • Governance Evidence:Budget/FinOps、Data Boundary、SSO/RBAC、audit log、SBOM、provenance。
  • Qualcomm Receipt:compile/profile/inference/download IDs、runtime、target device、latency、memory、fallback 和 artifact hash。

07 · Market & Business Model

第一批客户是有真实机器人数据和交付压力的人。

TrainRouter 赚的不是纯 GPU 价差,而是受控执行、数据边界、可复现评估、edge export 和证据包的钱。

LeRobot 开发者

需要固定预算、低摩擦训练、比赛展示和 reproducible eval pack。

机器人初创公司

需要把 demo 变成可复现版本发布,避免云脚本、数据和边缘部署断裂。

系统集成商

把训练成本、数据边界、验收指标和回滚写进 4-8 周试点合同。

企业治理买方

FinOps、安全、法务、采购需要 hard stop、approval、RBAC、region allowlist 和 SIEM audit。

Lane 默认值

海外 dev 用 Modal/RunPod/Lambda;海外企业用 CoreWeave/Lambda;中国 dev 用 AutoDL;中国企业用 PAI/腾讯/华为。

商业模式

Developer Starter、Pro Lab、SI Pilot、Enterprise Private Lane 和 Governance Pack。

08 · Competition & Moat

护城河不是“更会调度 GPU”,而是机器人训练证据链。

SkyPilot 已经覆盖多云 GPU arbitrage,W&B/MLflow 已经覆盖 artifact 和 registry。TrainRouter 的差异在机器人语义、数据边界、评测门禁和 Qualcomm edge receipt。

Contract observation/action schema、embodiment、sensor calibration、sim/real split、policy type 和 robot target。
Boundary China / Overseas / Private lane、region allowlist、data class、artifact/log residency。
Gate preflight、artifact、behavior、human approval、failure/intervention evidence 和 rollback drill。
Receipt AI Hub compile/profile/inference/download、QNN/QAIRT target、device-specific caveat 和 artifact hash。

09 · Why Qualcomm

云可以换,机器人本体上的边缘标准不能换。

TrainRouter 把“云训练完成”变成 Qualcomm 关心的交付物:checkpoint、ONNX/PT2、量化日志、AI Hub job IDs、目标设备、runtime、NPU placement、latency、memory、fallback、数值差异、artifact hash 和 rollback package。

Prototype-to-production

开发者不是只说“我训练好了”,而是带着 RB3/QCS6490、QCS8550、IQ 系列的可审计证据来关闭性能和算子问题。

Artifact Gate

compile、profile、inference 校验、download receipt、optrace/QHAS bottleneck 和 artifact hash 进入 release record。

Device-specific Truth

QNN context binary 是 SoC-specific;proxy 分数不能当真实硬件保证,profile 必须标注目标设备和运行时。

具体请求

AI Hub quota、Device Cloud/真实设备、QNN soc_model 映射、QNN EP 矩阵、QIR 样例、Profiler 模板和 Robotics Hub review。

10 · Demo & Ask

演示要证明的不是“云能跑”,而是“训练能交付”。

比赛 demo 从 `robot_job_contract.yaml` 开始,到 Qualcomm export receipt 和 rollback package 结束。中间每一步都要让评委看到商业客户会付钱的控制点。

Contract

选择 dataset revision、policy、target profile、lane、budget、spot policy 和 eval gate。

Admission

展示 schema、split hash、data class、region allowlist、estimated cost 和 hard stop。

Route

展示 provider 选择理由、fallback、checkpoint policy、cost burn 和 interruption recovery。

Gate

展示 fixed eval report、failure tags、intervention rate、baseline delta、replay videos 和 verdict。

Export

展示 AI Hub job IDs、runtime target、profile metrics、op fallback、artifact hash 和 SkillDock 状态。

TrainRouter 的一句话:把“租 GPU 训练模型”变成“按预算发布一个能在 Qualcomm 机器人上验证的技能版本”。

Claim Boundaries

边界讲清楚,可信度才会提高。

TrainRouter 不声称获得 Qualcomm 官方认证,不自动满足 PIPL/GDPR/EU AI Act,不保证云成本永不超支,不保证 spot 稳定,不承诺任意模型无损编译到 QNN,也不把 AI Hub profile latency 当最终机器人 app latency。所有指标必须标注 simulated、replay-eval、Device Cloud 或 measured-on-hardware,并附日期、板卡、SDK/runtime、模型版本和 dataset hash。