BotOf TechAI / IoT / Full-Stack / 植物养护知识分享
返回首页Planetary Prediction Engine:从一句问题到全球预测,Earth AI 如何避免数据泄漏

Planetary Prediction Engine:从一句问题到全球预测,Earth AI 如何避免数据泄漏

“预测未来一周哪些地区可能出现新的传染热点”看起来像一句自然语言问题,真正建模却要先决定空间粒度、时间范围和连接键,再从气候、人口、道路、卫生、遥感与公开报告中找信号,处理坐标和缺失值,避免把答案本身泄漏到特征,最后选择模型并做空间外推验证。

Google Research 8 月 27 日发布的实验性 Planetary Prediction Engine(PPE),尝试自动完成这条链。输入一个地理预测问题后,系统执行数据发现、清洗、特征工程、训练、评估并生成报告。Google 报告其把需要人工数据工程的数周流程压缩到分钟级,并在公共健康、粮食安全、环境风险和社会经济任务上取得改进。

“一句话生成全球预测”很吸引人,但 PPE 真正值得研究的是它没有把所有数据塞给一个 LLM,而是用三个模块化阶段、地理基础模型表示、严格 Feature Gate 和过拟合自纠正来限制自动化。

三阶段架构

阶段 1:把问题变成地理数据契约

系统先把自然语言转换为严格约束:空间粒度、join key、时间范围和预测目标。随后提出领域假设,寻找直接信号与有文献依据的因果代理,从 Data Commons、Google Earth Engine 等目录取数;已有仓库缺少的信号,则在推理时搜索政府与学术数据源。

这一步的难点不是搜索 API,而是语义对齐。同名县、市、健康区可能跨国家重复;行政边界会随年份变化;周数据和月数据不能随意拼接。可靠产物必须保留数据版本、授权、坐标参考、空间覆盖、采集时间和转换谱系。

阶段 2:结构化特征与地理基础表示融合

PPE 把显式统计协变量与两类预训练表示结合:AlphaEarth 表示编码卫星影像语义,Population Dynamics Foundation Models 表示社会人口的潜在状态。前者能捕捉地表与环境的复杂非线性模式,后者补充人口活动;显式变量则保留可解释信号。

消融实验的结论是两者互补,而不是 foundation embedding 取代传统统计。对于公共决策,能够说出“降雨、道路可达性和人口变化如何影响预测”通常和精度同样重要。

阶段 3:搜索模型,而不是默认深度网络

PPE 会比较正则化线性模型、梯度提升树和多层感知机等家族,并用 Overfitting Guard Protocol 预判数据风险、检测泛化失败、触发自我修正。小样本、强空间自相关任务中,简单模型可能比大网络更稳健;自动化的价值是让模型选择服从验证结果,而非技术偏好。

各阶段通过不透明数据句柄传递产物,而不是把完整地理数据序列化进 LLM prompt。这既绕开上下文窗口,也减少模型直接看到大规模敏感数据的机会,并允许数据平面与推理控制面分离。

Feature Gate 为什么是整套系统的核心

地理预测最常见的“神奇高分”来源是 target leakage。PPE 对每个候选协变量检查四类泄漏:

  1. 是否是目标的数学组成部分,例如用分子预测比率本身;
  2. 是否来自与目标相同的调查或采集过程,等价于换名读取答案;
  3. 是否是目标发生后的下游因果结果;
  4. 是否包含预测时点之后的未来信息。

例如预测旱灾后粮食不安全,灾后救助人数可能高度相关,但在灾前并不可用;用它训练回溯模型会得到漂亮分数,实时报预测时却不存在。

Feature Gate 需要数据血缘和时间语义,不是让 LLM 看字段名猜测。每个特征应附 available_atevent_time、采集方法、目标关系和版本;无法证明在预测时可获得的特征应默认拒绝。

公开结果应该如何解读

Google 报告:21 个 CDC 健康指标的平均 R² 为 76.8%,人工专家管线为 60.0%;FEMA 风险指标为 64.9% 对 60.0%;社会脆弱性指数为 66.2% 对 58.6%。在尼日利亚粮食安全从 ADM1 下采样到 ADM2 的任务中,R² 为 66.1%,基线 31.5%。在 2026 年刚果民主共和国埃博拉疫情的五次逐周预测中,Recall@10 为 83.3%,识别 18 个新进入健康区中的 15 个。

这些是研究 benchmark 结果,不等同于任意地区、任意危机的生产精度。不同任务的 R² 与 Recall@10 不能横向比较;地理边界、标签质量和基线强弱都会改变数字。对疫情热点而言,漏掉一个区域与多报一个区域的代价也不对称,单一 recall 不能决定资源分配。

空间数据不能用普通随机切分验收

邻近地区往往相似,随机把相邻网格分到训练与测试会让模型“隔壁抄答案”。时间序列也不能用未来数据预测过去。生产验收至少包含:

  • 空间留出:整块地区不参与训练,测真正跨区域外推;
  • 时间回测:每个时间点只使用当时可获得的数据;
  • 来源留出:移除关键数据源,测试系统对单一供应的依赖;
  • 边界敏感性:改变行政区划或网格尺度后,结论是否稳定;
  • 不确定性校准:高置信区域是否真的更可靠;
  • 数据延迟模拟:政府数据晚到、遥感被云遮挡时能否降级。

还要防止空间公平问题。数据丰富的城市常比偏远地区准确,平均分可能掩盖最需要援助地区的低质量预测。报告应分地区、人口群体和数据覆盖度呈现误差,并允许领域专家覆盖自动结果。

从研究原型到决策系统还差什么

PPE 的产物应该被视为带证据的候选模型,而不是自动政策。每次运行需固定查询、数据快照、特征清单、泄漏审查、切分策略、代码、随机种子和地图版本;引用的政府与学术网页也要归档,因为在线内容会变化。

危机响应中还需明确:谁批准模型投入使用,预测如何转成资源行动,错误由谁发现,何时撤回。模型可以把数周探索压缩到分钟,但人类审查数据合法性、地方语境与行动后果的时间不能被营销数字一起压掉。

我的判断

PPE 展示了一种比“LLM 直接预测地图”更可信的 Earth AI 路线:LLM 负责提出假设和编排,真实数据资产通过句柄进入专用处理,基础表示补充难以手工构造的信号,Feature Gate 与空间验证约束结果。

它最大的潜力是缩短科学家形成第一版可检验模型的时间,让更多假设快速进入严格评估;最大的风险则是自动生成一份视觉完整、指标漂亮却包含泄漏或空间偏差的报告。决定 PPE 是否有用的,不是它多久画出地图,而是每个像素能否追溯到当时可用的数据、正确的验证和清楚的不确定性。

参考资料