
机器人安全不能停在急停按钮,要建立从芯片到车队的安全案例
传统工业机器人依靠围栏、固定工位和确定性程序隔离风险。具身智能机器人会在人旁边移动、感知开放环境、使用学习策略并持续更新模型。急停依然必要,却无法单独回答:感知漏检怎么办,策略分布外怎么办,更新后旧场景是否退化,远程车队如何召回问题版本。
安全必须成为一条从硬件、系统软件、模型、仿真、真机测试到运营的证据链。
Safety case 是什么
安全案例不是一份“系统很安全”的报告,而是一组结构化论证:
安全目标
← 危险与场景分析
← 风险控制措施
← 测试与运行证据
← 配置、版本和责任人
它要说明每项风险由谁控制、控制失效如何被发现、哪些证据支持结论、软件或场景变化后哪些结论需要重验。
四条必须独立的安全链
1. 硬件与运动安全
- 急停与安全继电器;
- 制动、限速和安全扭矩关闭;
- 关节/驱动器限位;
- 电池、温度和电气保护;
- 碰撞结构与机械止挡。
主计算机死机时,这条链仍应有效。
2. 感知安全
学习型感知之外,保留可解释的近场保护:
- 安全激光或距离传感器;
- 防撞条;
- 原始点云/深度的最小距离监控;
- 传感器心跳、遮挡和污损检测;
- 多传感器一致性。
感知输出不仅要给障碍,还要给数据年龄、置信度和覆盖范围。
3. 行为与控制安全
高层策略提出“想做什么”,安全控制器决定“是否允许做”:
- 工作空间和速度包络;
- 禁止动作与区域;
- 动态制动距离;
- 人机最小距离;
- 力、力矩和接触限制;
- 控制超时与 watchdog。
大模型或 VLA 不应直接绕过这层输出驱动命令。
4. 发布与运营安全
- 模型、地图、标定和配置签名;
- 仿真与真机回归门槛;
- 小车队灰度;
- 事件自动上报;
- 一键回滚与版本召回;
- 远程操作权限和审计。
学习系统的风险会随版本变化,发布过程本身就是安全功能。
仿真怎样产生有效安全证据
仿真适合系统性覆盖真实场地难以反复制造的长尾:
- 行人突然进入;
- 传感器延迟、丢帧和错误时间戳;
- 制动性能下降;
- 摩擦变化;
- 物体倒下或门半开;
- 网络中断和主进程重启。
但仿真通过不代表真实安全。每个关键场景都要记录模型有效范围,并用硬件在环或真机实验校准。仿真与现实差异本身也是 safety case 的一项风险。
学习模型怎样进入安全流程
模型评测不能只看平均任务成功率。应建立:
- ODD 覆盖矩阵;
- 危险事件零容忍项;
- 分布外检测与保守策略;
- 对抗、遮挡和传感器退化测试;
- 运行间方差;
- 可解释的失败分类;
- 新旧版本对照。
模型无法证明绝对安全,因此系统要限制它能造成的最大后果。例如允许高层选择目标,但局部控制始终受速度、碰撞和力约束。
事件闭环
每次安全相关事件要保存:
事件前后传感器窗口
机器人状态与控制指令
任务、模型、地图、标定、软件版本
触发的安全规则
人工操作
最终结果与严重度
复盘后,事件进入危险分析、回归场景和发布门槛。安全案例不是交付时冻结的文档,而是随车队经验更新的系统资产。
组织责任
至少分清:
- 产品负责人定义允许场景;
- 安全负责人批准风险接受;
- 算法团队解释模型限制;
- 控制团队维护独立保护;
- 运维团队负责版本、监控和召回;
- 现场负责人拥有停机权。
不能让“算法准确率已经很高”成为风险接受理由,也不能让现场在不知情时承担实验版本。
具身智能走向规模化的标志,不是演示更像人,而是团队能回答每一种危险由哪层拦截、证据在哪里、失败后怎样恢复。