
具身智能的数据飞轮:仿真、人在回路与真机交互如何降低成本
语言模型可以从互联网上获得海量文本,机器人却没有同等规模的“动作互联网”。视频能展示人类如何做事,却通常缺少机器人关节、力矩、触觉和可执行动作;真机轨迹信息丰富,采集又昂贵、缓慢且有风险。
所以具身智能的数据问题并非一句“数据太少”能够概括。真正的矛盾是:便宜数据离动作较远,接近动作的数据又很贵。
低成本数据闭环的目标,不是找到一种万能数据源,而是让不同来源各自解决不同问题,并把现场失败自动转化为下一轮改进材料。
五类数据各自能教会机器人什么
| 数据来源 | 主要价值 | 主要缺陷 |
|---|---|---|
| 人类公开视频 | 场景、物体、任务先验和行为常识 | 缺少机器人动作与传感器状态 |
| 遥操作与示范 | 观测—动作对应,成功路径清晰 | 人工昂贵,操作者风格不一致 |
| 仿真与合成数据 | 可并行、可控、可覆盖危险长尾 | 存在视觉和动力学偏差 |
| 真机自主交互 | 最贴近部署分布,可暴露真实问题 | 重置、磨损、安全成本高 |
| 人工干预片段 | 聚焦高风险边界和恢复动作 | 数量少,需要准确记录上下文 |
把所有数据混在一个仓库里并不会自动形成能力。它们的动作空间、坐标系、传感器、频率、成功定义和许可证可能完全不同,必须先建立统一语义。
数据闭环的最小单位不是视频,而是事件
一条可用于训练和诊断的机器人事件,至少应包含:
- 任务目标、场景与对象标识。
- 相机、深度、力矩、触觉和本体状态的时间同步记录。
- 控制指令、策略版本与动作空间定义。
- 成功、失败、中止和人工接管标签。
- 失败前的触发状态、修正动作与最终结果。
- 机器人、传感器、标定、工件和环境版本。
没有这些上下文,一段“机器人抓取失败”的视频很难回答是识别错、坐标变换错、夹爪打滑,还是策略本身失效。
建立闭环的七个步骤
1. 从任务树定义数据契约
先把任务拆成可观察的阶段,例如接近、对准、接触、夹持、搬运、放置。为每一阶段定义输入、动作、结果和失败类型。这样不同团队与不同机器人采集的数据才有共同语言。
2. 用示范建立起点
示范数据负责告诉策略“合理动作大致在哪里”。应刻意覆盖多个视角、初始位姿和速度,而不是让操作者重复同一条完美轨迹。少量多样化示范通常比大量重复示范更有价值。
3. 用仿真系统性扩长尾
仿真用于生成现实中危险、低频或难复现的组合:遮挡、光照变化、传感器丢帧、摩擦改变、部件偏差、行人突然进入。世界模型还可以从有限真机片段生成更多环境和轨迹候选。
关键是给每个仿真参数记录来源:哪些来自现场统计,哪些是假设。否则随机化范围会逐渐脱离真实世界。
4. 用真机校准仿真偏差
把仿真策略放到真机后,不要只统计成功率。要比较观测分布、动作延迟、接触力、失败阶段和恢复行为,找出差异最大的变量,再回写仿真。
Sim2Real 不应是一条单向发布链,而应是 Real2Sim2Real:现场持续校准数字世界。
5. 把人工干预当作主动学习
人类只在策略不确定、即将越界或陷入循环时介入。系统根据模型不确定性、异常检测和任务风险请求帮助,人工修正则成为边界附近的高价值样本。
干预率下降并不是唯一目标。如果机器人因为过度保守而从不尝试,干预率也会很低。应同时看自主完成率、周期时间和安全事件。
6. 自动挖掘难例与重复问题
按失败阶段、环境、对象、策略版本和传感器异常聚类现场日志。优先处理重复出现、影响多台机器人、可以复现且业务损失高的问题,而不是随机抽样更多正常运行视频。
7. 训练、评测、灰度、回滚
新数据进入训练前先去重、检查标定和标签;新模型必须通过固定回归集、仿真压力测试和受控真机测试;发布时从单机、单班次、小流量逐步扩大,并保留快速回滚。
如何计算一条数据值不值得采
可以给候选数据定义一个近似投资回报:
数据价值
= 新颖度 × 失败损失 × 预期性能提升 × 可复用范围
÷(采集 + 标注 + 重置 + 存储 + 设备损耗)
这会改变采集策略:
- 第 10,000 条相似成功抓取,边际价值很低。
- 一条能解释高价值装配为什么偶发卡死的干预轨迹,价值很高。
- 一段无法对齐动作、没有许可信息的视频,训练价值可能接近零。
- 一个可复现的仿真长尾场景,可以反复用于训练和回归,复用价值很高。
数据团队的目标应从“累计多少小时”转为“每增加一小时数据,任务曲线改善多少”。
跨本体数据为什么难,为什么仍值得做
不同机器人拥有不同关节数量、夹爪、相机和动作频率。把它们统一成同一个动作向量通常不可行,但可以在三层共享:
- 语义层:任务、对象、成功条件和阶段。
- 技能层:抓、推、插、旋拧等抽象动作与目标位姿。
- 本体层:由适配器将技能映射到具体关节和控制接口。
跨本体数据最先带来的价值,往往不是直接复制低层动作,而是共享视觉表征、任务结构、失败模式和高层策略。开放数据集已经证明,多机构、多场景的数据标准化可以提高策略对新环境的鲁棒性,但本体适配和现场微调仍不可省略。
数据平台应该留下哪些资产
一个健康的数据飞轮最终会沉淀:
- 统一的机器人事件格式和时间同步方案。
- 可搜索的任务、对象、失败与介入本体。
- 仿真资产、参数分布和现实校准记录。
- 固定回归集、危险长尾集和新场景集。
- 数据谱系:每个模型由哪些数据训练而来。
- 删除、脱敏、授权和保留周期机制。
这些资产比某一代模型更持久。模型架构会快速变化,但只要数据能够解释“机器人看到了什么、做了什么、结果如何、为什么被人纠正”,团队就有能力持续升级。
真正低成本的数据闭环不是尽可能少采真机数据,而是让每次昂贵的真机交互都用于验证一个明确假设,并通过仿真、训练和车队发布被多次复用。具身智能的规模化,最终取决于能否把一次现场失败变成整个系统的共同记忆。