
Model Hardware Standard:Physical AI 需要的不是万能机器人,而是可验证的设备协议
AI Agent 进入物理世界时,最先遇到的通常不是“模型不会推理”,而是每台设备都有不同的控制方式:现代 REST API、旧式 ActiveX/COM、厂商 SDK、投递 XML 的目录监听器,甚至只有人能操作的 GUI。让一套实验流程跑起来,往往需要工程师为每个仪器写胶水代码,再手工维护状态、顺序和错误处理。
Anthropic 在 8 月 27 日预览的 Model Hardware Standard(MHS),目标是给可编程物理设备提供一种模型无关的描述与控制层。它不是一个新机器人操作系统,也不是让大模型直接输出电机脉冲,而是把设备的状态、能力和过程整理成 Agent 可理解、系统可校验的契约。
MHS 位于哪一层
最容易产生的误解,是把 MHS 和 MCP、设备驱动、实时控制混成一个协议。更合理的分层是:
- MCP 负责 Agent 如何发现和调用工具;
- MHS 负责设备有哪些状态、能执行哪些过程,以及共享环境当前发生了什么;
- 驱动/适配器 把统一语义翻译为厂商接口;
- PLC、运动控制器和安全联锁 继续负责实时、确定性与硬安全。
大模型适合决定“根据上一轮曲线是否缩小浓度范围”,不适合以自然语言闭环控制亚毫秒级激光、扭矩或温控。Anthropic 的设计同样强调:高层推理与快速、长时间运行的确定性脚本结合,而不是让 token 生成取代控制器。
状态与过程比“工具列表”更重要
一个可靠设备接口不能只声明 move_plate() 或 dispense()。它还需要暴露可验证状态,例如:样品板是否在位、方向是否正确、舱门是否关闭、设备是否忙碌、急停是否触发、温度是否达到稳定区间。
MHS 把不同设备映射成统一 manifest:
- states 描述系统条件和共享事实;
- procedures 描述可执行动作、前置条件和结果;
- shared state dictionary 让多个设备围绕同一物理对象协作;
- skills/recipes 固化专家发现的操作模式与失败恢复。
这使 Agent 不必记住“第三台 Windows 电脑的某个窗口出现绿色图标才表示完成”,而是读取规范化状态。设备仍可以在底层使用原生软件,MHS 只在上方建立一致的编排面。
CMU 案例说明了价值,也说明了边界
Carnegie Mellon University 的预览案例把液体处理器、酶标仪、机械臂和摄像头分布在三台电脑上:一台通过目录投递任务,一台使用旧式 COM 接口,一台酶标仪甚至没有程序接口,只能操作 GUI。团队报告从设备可用到跑完一次包含自动重试的稀释曲线约用了八小时,而厂商集成通常需要数周。
工作流没有被“AI 魔法”替换:液体处理器准备序列,摄像头确认样品板存在且方向正确,机械臂搬运,读板机测量,Agent 判断曲线是否可接受。第一次结果因高浓度饱和导致拟合低于阈值,系统把最高浓度从 200 µg/mL 调到 100 µg/mL,换新板重跑,得到更好的拟合。
团队还人工注入六类异常:缺板、板旋转、读板机忙、摄像头断开、设备不可达和急停激活。系统在设备移动前阻止了全部六类。这个细节比“八小时完成集成”更重要:Physical AI 的正确性不只是任务完成,还包括在错误状态下不动作。
但这些数字来自研究预览和特定实验配置,不代表任何实验室都能从数周缩短到八小时。真实采用还取决于设备是否可编程、驱动质量、校准、网络可靠性、操作规程和安全认证。
物理自动化有四种数字系统没有的失败
1. 状态可以过期
摄像头一秒前看到样品板,不代表机械臂动作时它仍在原位。关键状态需要时间戳、置信度和有效期,动作前必须重新确认。
2. 副作用不可回滚
数据库更新可以事务回滚,液体已经混合、样品已经污染、机械臂已经碰撞则不能。系统要用预演、分阶段提交和物理隔离降低后果。
3. 传感器会同时错
共享状态字典如果依赖同一摄像头或同一标定,会形成共同故障。高风险条件需要异构传感器、硬限位或人工复核。
4. 单位和坐标系会杀死流程
µL 与 mL、摄氏与开尔文、机械臂基座坐标与相机坐标的混淆,模型可能无法从文本上察觉。单位、坐标系、容差和校准版本必须进入类型系统,而不是藏在 description。
一套可上线的安全契约
Physical AI 的动作可按后果分级:
| 等级 | 示例 | 默认控制 |
|---|---|---|
| L0 观察 | 读取图像、温度、设备状态 | 只读、限频、记录来源 |
| L1 可逆准备 | 移动到安全预备位、生成脚本 | 仿真/预演、状态校验 |
| L2 有限副作用 | 移液、搬运普通样品 | 双重传感、预算、可中止 |
| L3 高后果 | 高能激光、危险试剂、人体相关实验 | 独立联锁、人工批准、隔离区 |
急停必须独立于 Agent、MHS 服务和通用网络;安全控制器即使看不到模型,也能把系统带到安全状态。所有命令应带 run ID、设备状态版本、参数单位、审批凭证与超时,并记录传感器证据和实际执行结果。
如何验收一个 MHS 集成
不要只演示一次成功流程。验收至少包括:
- manifest 与真实设备能力是否一致,未知状态是否默认拒绝;
- 驱动断线、超时、重复回调和部分完成时能否恢复;
- 六类以上故障注入能否在物理动作前拦截;
- 状态是否带来源、时间和置信度,多个设备是否一致;
- Agent 计划是否能转换为确定性脚本并接受静态检查;
- 人工接管、急停与事后轨迹能否独立工作;
- 重跑能否复现实验条件、耗材批次、校准和软件版本。
我的判断
MHS 最重要的贡献,是把 Physical AI 的瓶颈从“模型是否聪明”拉回到接口与证据。模型可以提出更好的实验、处理非预期结果并协调多设备,但物理系统的安全仍来自清晰状态、严格前置条件、确定性执行和独立联锁。
目前 MHS 仍是研究预览,尚未完全开源,生态、互操作性和长期兼容都要继续验证。它是否成为真正标准,不取决于演示里接了多少设备,而取决于不同机构能否复用驱动、表达相同安全语义,并在失败时得到一致、可审计的行为。