
具身智能的新闭环:让策略先想象、再判断、最后用真机失败继续训练
行为克隆给机器人看一批成功示范,再让它模仿,是具身学习最直接的起点。但它有两个根本限制:策略不知道动作之后会发生什么,也不知道任务是否真的完成。
最近一批开源机器人学习工具开始把四个部件接到一起:世界模型负责预测未来,策略根据未来选择动作,奖励模型判断成功,部署工具把失败与人工纠偏重新写回数据集。
这比单纯增加 VLA 参数更重要,因为它让机器人获得一个可以持续迭代的工程闭环。
世界模型不是一段“生成得很像”的视频
对控制有用的世界模型至少要回答:
给定当前观测 o_t 和候选动作 a_t
未来状态 o_(t+1:t+h) 会怎样变化?
哪些变化与任务成功相关?
哪些动作会进入危险或不可恢复状态?
它可以在像素、隐变量、物体状态或三维场景中预测。生成画面逼真只是表象,更重要的是:
- 动作条件是否有效;
- 接触、遮挡和物体持久性是否合理;
- 多步误差是否迅速发散;
- 预测能否帮助动作排序;
- 计算是否能在控制预算内完成。
部署时不一定真的生成完整视频。很多系统只在紧凑隐空间里比较若干候选未来,再把最优动作交给低层控制器。
奖励模型解决“是否做成”
真实机器人任务很难用一个传感器阈值定义成功。杯子被抓起来不等于已经稳定放到托盘;抽屉移动了不等于完全关闭;清理桌面需要同时判断多个物体和区域。
奖励模型可以读取任务描述、初始状态、过程与结果,输出:
- 成功概率;
- 失败发生在哪个阶段;
- 是否需要人工复核;
- 哪些轨迹值得进入训练。
但奖励模型也会被策略“钻空子”。因此不能只用单一视觉奖励。生产系统应把奖励拆成:
任务奖励 = 视觉/语言判断
+ 几何与力学约束
+ 安全护栏
+ 人工抽检
所有不可逆和高风险动作都应有确定性约束,不能由一个 learned reward 决定。
人在回路不只是遥操作
最有价值的数据往往出现在策略即将失败时。一个部署工具应支持:
- 机器人自主执行;
- 不确定性或安全规则触发请求;
- 人类短暂接管并完成修正;
- 系统保存接管前窗口、修正动作和结果;
- 新轨迹进入 DAgger 式训练或难例池。
这比从头遥操作整条成功轨迹更高效,因为人工只花在决策边界。
需要同时记录“为什么接管”。否则下一轮训练只能模仿动作,无法区分是视觉遮挡、目标歧义、碰撞风险还是策略犹豫。
统一评测为何重要
机器人论文经常在不同仿真器、任务定义和成功判据上报告结果,数字很难横向比较。统一 CLI、容器、基线检查点和数据格式可以把评测变成持续集成:
提交策略
→ 固定版本环境
→ 多随机种子运行
→ 记录成功、碰撞、时长和动作平滑度
→ 与基线和上版比较
→ 决定是否允许真机灰度
仿真评测不能代替真机,但能拦住明显回退,并把高成本真机时间留给最有信息量的候选。
一套可落地的训练—部署链
数据契约
每条 episode 至少包含:
- 多相机、深度、关节、力矩和控制指令;
- 统一时间轴;
- 任务语言与对象标识;
- 策略、机器人、标定和环境版本;
- 成功、失败、中止、接管与原因;
- 数据授权和保留策略。
三层评测
- 离线:动作预测、奖励一致性、世界模型误差。
- 仿真:成功率、碰撞、长尾扰动、恢复能力。
- 真机:有限场景、小速度、人工在场、可快速急停。
发布门槛
不要只要求平均成功率上升。还要限制:
- 严重安全事件为零;
- P95 完成时长不恶化;
- 人工接管率不升高;
- 新场景收益不能以旧场景灾难性遗忘为代价;
- 失败必须可从日志重放。
工程上最值得关注的变化
新一代开源工具把世界模型、VLA、奖励模型、深度数据、自动语言标注、统一 benchmark、分布式训练和真机 rollout 放在同一套接口下。其意义不是“一键训练通用机器人”,而是降低团队搭建闭环的集成成本。
真正的竞争仍然在现场:谁能定义稳定任务、同步传感器、管理版本、捕获难例、复现失败并安全灰度。世界模型让机器人在行动前多一次预测,奖励模型让系统知道结果是否可信,而持续部署闭环决定这些能力能否越跑越好。