
物理 AI 的下一步不是更大的云模型,而是可回放的数据工厂与边缘世界模型
把一个视觉—语言—动作模型装到机器人上,不等于得到可部署的物理 AI。机器人会进入持续变化的场景:光照、摩擦、货物位置、人员路线、相机污损、通信延迟都会改变。只靠一次离线训练,无法覆盖这些组合。
更接近生产的架构,是一座连接数字场景、合成数据、策略训练、仿真评测、边缘推理和现场日志的数据工厂。
为什么物理 AI 需要自己的“数据供应链”
互联网模型主要消费已经存在的数据,机器人数据则需要主动生产。每条真机轨迹都要占用设备、场地和人员,还伴随磨损与安全风险。
因此数据工厂要把昂贵真机事件放大:
一次现场失败
→ 还原场景与初始状态
→ 在仿真中生成可控变体
→ 训练与回归测试
→ 小流量真机验证
→ 车队灰度发布
如果现场日志无法还原到数字场景,失败只是一段视频;如果可以回放,它会变成持续使用的测试资产。
统一场景描述是底座
CAD、BIM、机器人模型、材质、传感器、灯光和行为脚本经常来自不同工具。场景描述层的任务不是“做一张漂亮数字孪生”,而是保证这些资产拥有稳定身份、坐标、版本和依赖。
一套可用的场景资产需要记录:
- 几何与碰撞几何分别是什么;
- 关节、质量、摩擦和驱动参数;
- 传感器内参、外参与噪声模型;
- 物体语义、可交互部位和任务状态;
- 哪些参数来自实测,哪些只是合理假设;
- 资产和真实设备的版本映射。
开放场景标准的价值在于让设计、仿真、训练和可视化复用同一份结构,而不是每个团队导出一份已经失去语义的网格。
世界模型在数据工厂里做什么
世界模型可以承担三类工作。
1. 扩展观测分布
改变光照、视角、遮挡、材质、人员和背景,生成传感器外观变体。这里需要保持几何和任务标签一致,不能只追求视觉多样。
2. 生成候选未来
给定当前状态和动作,预测几步之后可能出现的结果,用于策略预训练、规划候选排序或风险筛查。
3. 构造长尾场景
把真实车队里低频但高损失的事件参数化:叉车突然驶出、门半开、传感器短时失真、地面摩擦下降、网络抖动。它们很难在真实场地反复制造,却适合在仿真中大规模回归。
世界模型不是物理引擎的替代品。涉及接触稳定性、制动距离、力矩和结构极限时,仍需要可解释的动力学、实测标定和安全余量。合理组合是:生成模型扩展场景与先验,物理仿真约束运动,真机数据校准偏差。
为什么边缘世界模型开始重要
云端适合大规模生成、训练和离线分析;机器人端需要在几十到几百毫秒内做判断,并在断网时继续安全运行。
边缘模型的目标不是复制云端全部能力,而是承担短时、局部、强时限任务:
- 预测局部动态障碍;
- 为若干候选轨迹估计未来占据;
- 判断当前动作是否可能进入不可恢复状态;
- 生成感知补全或不确定性;
- 对现场事件做初步筛选和压缩。
端侧模型必须有算力预算、最大推理时长和回退路径。一次生成超时不能阻塞基础控制和碰撞保护。
从实验室到生产的最小闭环
数据入口
统一采集原始传感器、状态、动作、任务、人工接管和失败码。所有通道使用同一时间基准,并记录硬件、标定、软件和模型版本。
场景重建
把关键事件转换成可重放场景。先追求“能复现失败”,再追求高保真画面。
变体生成
围绕导致失败的参数采样,不要无目的随机化。若问题来自逆光,就系统扫描曝光与角度;若来自轮滑,就改变摩擦和载荷。
多级评测
同一策略依次经过离线数据、快速仿真、精细仿真、硬件在环和真机灰度。每一级都有独立门槛。
现场回流
只上传高价值窗口和结构化摘要,避免所有原始视频无差别上云。优先级可由新颖度、风险和不确定性决定。
衡量数据工厂的指标
不要只数生成了多少小时视频。更有意义的是:
- 一个现场失败转成可重放测试需要多久;
- 仿真能否稳定复现同一失败;
- 每轮训练后哪些失败簇被消除;
- 仿真通过但真机失败的比例;
- 新策略的接管率和严重事件是否下降;
- 同一资产是否被多种机器人和任务复用。
物理 AI 的规模化最终依赖一个朴素能力:让现实问题能进入数字系统,让数字改进能安全回到现实。边缘世界模型缩短反应链,数据工厂扩大每次真机经验,两者共同构成持续进化的基础设施。