
科学 Agent 的核心不是提出更多假设,而是更快走到可验证结果
大模型很容易生成听起来合理的研究方向。科学价值却不来自想法数量,而来自证据:假设是否可证伪,实验是否控制变量,代码与数据能否复现,负结果是否被保留,结论是否超出观测。
科学 Agent 的目标应从“自动写论文”改为“缩短从问题到可重复证据的周期”。
科研工作流需要五种系统
文献与知识
→ 假设和实验设计
→ 代码 / 仿真 / 仪器
→ 数据分析与交叉验证
→ 专家审查和新一轮实验
模型只占其中一部分。它必须通过工具连接版本化文献库、HPC、实验设备、数据仓库和电子实验记录。
文献检索不能只做语义相似
科学证据存在引用链、研究设计、样本量、数据集和相互矛盾的结果。检索层应保留:
- 标题、作者、年份和版本;
- 论文、预印本、数据与代码关系;
- 引用和被引用;
- 实验条件与适用范围;
- 撤稿、更正和争议;
- 原文证据位置。
Agent 生成综述时要区分“已有实验证明”“某模型预测”“本文推断”。不能把多篇相似表述投票成事实。
假设必须可执行和可否证
一个可进入系统的假设至少包含:
研究对象
可操纵变量
可观测结果
对照与基线
预期效应
否证条件
风险与资源
“材料 X 可能更好”不能调度实验。“在固定压力和成分下,材料 X 的临界温度相对基线提高至少 Y,测量不确定度小于 Z”才可以。
模型可以生成候选,但优先级由新颖性、可验证性、资源成本、安全和潜在价值共同决定。
代码和仿真需要执行证据
科学 Agent 写出的代码必须:
- 固定环境和依赖;
- 记录输入数据哈希;
- 使用随机种子和数值精度;
- 输出中间产物;
- 与基线方法比较;
- 运行单元和统计检查;
- 保留失败实验。
HPC 调度还要控制资源预算,防止模型无限扩大参数扫描。Agent 应先用小规模 sanity check,再进入大规模计算。
湿实验与高后果设施必须分级授权
模型提出实验不等于可以执行。工具权限应按风险分层:
| 级别 | 能力 |
|---|---|
| S0 | 检索、分析公开数据 |
| S1 | 运行隔离代码与仿真 |
| S2 | 生成实验草案和物料清单 |
| S3 | 经专家批准后调度低风险仪器 |
| S4 | 高风险生物、化学、能源设施,仅限严格受控团队 |
所有真实实验保留人类负责人、设备联锁、物料追踪和停止条件。模型不能通过拆分步骤绕过审批。
验证器要独立
科学 Agent 最危险的失败不是语法错误,而是使用同一错误假设解释所有结果。交叉验证可以包括:
- 独立代码实现;
- 不同数值方法;
- 留出数据;
- 盲法或预注册;
- 仪器重复测量;
- 专家复核;
- 与已知物理/化学边界比较。
验证器读取原始数据和实验协议,不只读取 Agent 的摘要。
评价指标
比“生成论文数”更有意义的是:
- 从问题到第一个可证伪假设的时间;
- 从假设到可重复实验的时间;
- 失败实验被正确记录的比例;
- 独立复现率;
- 每个验证结论的计算/实验成本;
- 人工发现的重大设计缺陷;
- 安全升级是否及时;
- 新知识能否回写共享研究资产。
国家实验室式系统为什么值得关注
前沿模型正在与超级计算机、科学数据、模拟器和实验设施结合。其工程意义不只是给研究人员更多对话额度,而是建立共同评测、可信访问、研究工具和大规模科学 campaign。
这类系统必须同时处理能力和风险:模型越能写代码、使用网络和发现漏洞,科研环境的身份、沙箱和数据边界越重要。
AI 可以让科学家更快遍历候选,但只有实验、复现和同行审查能把候选变成知识。最好的科学 Agent 不会让研究看起来更确定,而会让不确定性更早暴露、更便宜地被验证。