
全球首个双盲前沿 AI 评测:模型和题库如何在机密 GPU 飞地里相遇
高风险 AI 评测长期存在一个难解的交换:外部评测方把私有题库交给模型公司,题目可能泄露并进入后续训练;模型公司把权重交给评测方,又会暴露核心知识产权与安全敏感能力。双方依赖保密协议、零日志承诺和受控访问,但任何一方都很难技术性证明另一方没有复制材料。
Google DeepMind 在 8 月 27 日宣布与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 试点其所称首个专有前沿级模型的双盲评测。试点让 Gemini Flash Lite 在私有 benchmark 上运行:评测方看不到模型权重,Google 看不到测试 prompt,只有机密计算环境能够同时解密并执行两者。
这不是让评测“绝对无需信任”,而是把信任从组织承诺转移到更小、可度量和可证明的计算边界。
什么是双盲
传统盲评只隐藏模型身份或题目的一侧。这里的双盲指:
- 模型所有者不知道具体测试内容,无法针对题目微调或把它加入训练;
- 评测者不知道模型内部资产,不能读取、复制权重或未公开实现;
- 执行环境受双方预先认可的代码与策略约束,输出只按协议离开。
核心不是“把两份文件放进同一虚拟机”,而是 remote attestation:双方在释放密钥前验证运行环境、启动代码、配置和硬件安全状态符合约定。任何镜像、调试权限或输出策略变化都会改变测量值,密钥服务可以拒绝解密。
Confidential Space 与 GPU 飞地解决什么
Google 使用 Confidential Space 和机密计算组合保护执行过程。理想情况下,数据在传输时加密、存储时加密,进入受保护 CPU/GPU 环境后才解密;云管理员、模型团队和评测团队都不能直接读取另一方资产。
这一设计同时降低三类风险:
- benchmark contamination:模型公司无法在评测前看到题目,也更难把题目加入后续训练;
- 模型窃取:评测者只能按协议提交输入、取得受限结果,不持有权重;
- 数据主权:政府、医疗或网络安全机构可在不向模型公司公开敏感数据的前提下测试。
它也使独立评测覆盖更高敏感度任务。过去某些机构宁愿不测,也不能把攻击样本、政府数据或未公开事故交给供应商;机密执行让“可以评估但不能互相看见”成为可能。
远程证明不是魔法公证
证明只能回答一组有限问题:某个硬件是否以某个工作负载和配置启动,密钥是否只发给该测量值。它不能自动证明:
- 评测代码本身没有 bug 或偏见;
- benchmark 真正测到了目标能力;
- 模型在训练历史中从未见过同源数据;
- GPU 固件、供应链和证明服务没有漏洞;
- 输出通道不会通过日志、时间或错误信息泄漏题目;
- 双方发布的最终分数没有选择性报告。
因此双盲评测仍需信任评测设计、硬件根、云控制面、密钥服务和报告治理,只是这些信任可以被拆开审计,而不再要求“完全相信模型公司不会看题”。
一次可信评测需要七类证据
| 证据 | 需要回答的问题 |
|---|---|
| 工作负载测量 | 运行的确实是双方审核过的镜像与评分代码吗 |
| 硬件证明 | 飞地、固件和安全状态是否在允许基线内 |
| 密钥策略 | 谁、在什么证明条件下可以解密哪份资产 |
| 输入承诺 | 题库版本是否在模型执行前固定,是否中途替换 |
| 模型承诺 | 评测的权重与声明版本是否一致 |
| 输出策略 | 哪些指标、日志和样本能离开飞地,是否有泄漏 |
| 结果签名 | 分数能否绑定模型、题库、代码、配置和时间 |
最有用的报告不是一个孤立分数,而是可验证 manifest:模型哈希、题库承诺值、容器测量、硬件证明、采样配置、随机种子、评分器版本和聚合结果。敏感内容可以不公开,承诺值与签名应足够让授权方复核。
双盲仍然挡不住同源污染
模型公司看不到最终私有题库,不代表模型没有见过相同网页、题目模板或前一版本。评测方需要构造真正新鲜的数据,记录来源时间,并用变体、动态生成和污染探针检查记忆。若只把一个早已公开的 benchmark 加密后再跑,机密计算保护了文件,却没有恢复测量有效性。
此外,API 交互也可能逐步泄漏题目分布。评测次数、错误信息、token 级输出、延迟和多轮自适应查询都应有预算;评测结束后,环境和明文内存要可证明销毁。
企业怎样采用这套模式
并非所有评测都需要 GPU 飞地。公开常识问答用普通独立测试即可;当题库泄露会使价值归零,或数据依法不能交给供应商时,双盲才有明显收益,例如:
- 未公开网络攻击链和防御日志;
- 医疗、金融与政府受监管数据;
- 模型发布前的能力阈值评测;
- 采购竞标中的统一私有业务题库;
- 多供应商在同一敏感数据上的公平比较。
上线前应做故障注入:证明值不匹配、镜像被改、密钥服务失联、GPU 重置、输出超限和中途崩溃时,是否默认不解密、不留下明文,并能生成一致的失败证据。
我的判断
双盲评测最重要的意义,是让“独立评测”不再以单方面泄露资产为代价。它把模型、题库和执行者分离,用密码学证明建立一次性会面,这对高价值 benchmark 和主权数据尤其重要。
但可信 AI 评测最终仍是一条证据链:新鲜而有效的题目、受控执行、可验证模型版本、正确评分和完整报告缺一不可。机密计算能保护试卷不被偷看,却不能保证试卷出得好。真正的进步,是终于可以同时讨论评测的科学有效性与执行完整性,而不是被“谁先交出秘密”卡住。