BotOf TechAI / IoT / Full-Stack / 植物养护知识分享
返回首页全球首个双盲前沿 AI 评测:模型和题库如何在机密 GPU 飞地里相遇

全球首个双盲前沿 AI 评测:模型和题库如何在机密 GPU 飞地里相遇

高风险 AI 评测长期存在一个难解的交换:外部评测方把私有题库交给模型公司,题目可能泄露并进入后续训练;模型公司把权重交给评测方,又会暴露核心知识产权与安全敏感能力。双方依赖保密协议、零日志承诺和受控访问,但任何一方都很难技术性证明另一方没有复制材料。

Google DeepMind 在 8 月 27 日宣布与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 试点其所称首个专有前沿级模型的双盲评测。试点让 Gemini Flash Lite 在私有 benchmark 上运行:评测方看不到模型权重,Google 看不到测试 prompt,只有机密计算环境能够同时解密并执行两者。

这不是让评测“绝对无需信任”,而是把信任从组织承诺转移到更小、可度量和可证明的计算边界。

什么是双盲

传统盲评只隐藏模型身份或题目的一侧。这里的双盲指:

  • 模型所有者不知道具体测试内容,无法针对题目微调或把它加入训练;
  • 评测者不知道模型内部资产,不能读取、复制权重或未公开实现;
  • 执行环境受双方预先认可的代码与策略约束,输出只按协议离开。

核心不是“把两份文件放进同一虚拟机”,而是 remote attestation:双方在释放密钥前验证运行环境、启动代码、配置和硬件安全状态符合约定。任何镜像、调试权限或输出策略变化都会改变测量值,密钥服务可以拒绝解密。

Confidential Space 与 GPU 飞地解决什么

Google 使用 Confidential Space 和机密计算组合保护执行过程。理想情况下,数据在传输时加密、存储时加密,进入受保护 CPU/GPU 环境后才解密;云管理员、模型团队和评测团队都不能直接读取另一方资产。

这一设计同时降低三类风险:

  1. benchmark contamination:模型公司无法在评测前看到题目,也更难把题目加入后续训练;
  2. 模型窃取:评测者只能按协议提交输入、取得受限结果,不持有权重;
  3. 数据主权:政府、医疗或网络安全机构可在不向模型公司公开敏感数据的前提下测试。

它也使独立评测覆盖更高敏感度任务。过去某些机构宁愿不测,也不能把攻击样本、政府数据或未公开事故交给供应商;机密执行让“可以评估但不能互相看见”成为可能。

远程证明不是魔法公证

证明只能回答一组有限问题:某个硬件是否以某个工作负载和配置启动,密钥是否只发给该测量值。它不能自动证明:

  • 评测代码本身没有 bug 或偏见;
  • benchmark 真正测到了目标能力;
  • 模型在训练历史中从未见过同源数据;
  • GPU 固件、供应链和证明服务没有漏洞;
  • 输出通道不会通过日志、时间或错误信息泄漏题目;
  • 双方发布的最终分数没有选择性报告。

因此双盲评测仍需信任评测设计、硬件根、云控制面、密钥服务和报告治理,只是这些信任可以被拆开审计,而不再要求“完全相信模型公司不会看题”。

一次可信评测需要七类证据

证据需要回答的问题
工作负载测量运行的确实是双方审核过的镜像与评分代码吗
硬件证明飞地、固件和安全状态是否在允许基线内
密钥策略谁、在什么证明条件下可以解密哪份资产
输入承诺题库版本是否在模型执行前固定,是否中途替换
模型承诺评测的权重与声明版本是否一致
输出策略哪些指标、日志和样本能离开飞地,是否有泄漏
结果签名分数能否绑定模型、题库、代码、配置和时间

最有用的报告不是一个孤立分数,而是可验证 manifest:模型哈希、题库承诺值、容器测量、硬件证明、采样配置、随机种子、评分器版本和聚合结果。敏感内容可以不公开,承诺值与签名应足够让授权方复核。

双盲仍然挡不住同源污染

模型公司看不到最终私有题库,不代表模型没有见过相同网页、题目模板或前一版本。评测方需要构造真正新鲜的数据,记录来源时间,并用变体、动态生成和污染探针检查记忆。若只把一个早已公开的 benchmark 加密后再跑,机密计算保护了文件,却没有恢复测量有效性。

此外,API 交互也可能逐步泄漏题目分布。评测次数、错误信息、token 级输出、延迟和多轮自适应查询都应有预算;评测结束后,环境和明文内存要可证明销毁。

企业怎样采用这套模式

并非所有评测都需要 GPU 飞地。公开常识问答用普通独立测试即可;当题库泄露会使价值归零,或数据依法不能交给供应商时,双盲才有明显收益,例如:

  • 未公开网络攻击链和防御日志;
  • 医疗、金融与政府受监管数据;
  • 模型发布前的能力阈值评测;
  • 采购竞标中的统一私有业务题库;
  • 多供应商在同一敏感数据上的公平比较。

上线前应做故障注入:证明值不匹配、镜像被改、密钥服务失联、GPU 重置、输出超限和中途崩溃时,是否默认不解密、不留下明文,并能生成一致的失败证据。

我的判断

双盲评测最重要的意义,是让“独立评测”不再以单方面泄露资产为代价。它把模型、题库和执行者分离,用密码学证明建立一次性会面,这对高价值 benchmark 和主权数据尤其重要。

但可信 AI 评测最终仍是一条证据链:新鲜而有效的题目、受控执行、可验证模型版本、正确评分和完整报告缺一不可。机密计算能保护试卷不被偷看,却不能保证试卷出得好。真正的进步,是终于可以同时讨论评测的科学有效性与执行完整性,而不是被“谁先交出秘密”卡住。

参考资料