中文

基于 Linguistic Belief 序列贝叶斯更新的智能体预测

人工智能 2026-05-05 v3

摘要

我们提出了贝叶斯语言预测师(Bayesian Linguistic Forecaster, BLF),一个实现 ForecastBench 基准测试中最先进性能的智能体预测系统。该系统建立在三个观念之上:(1) 语言信念状态:一种半结构化的表征,结合数值概率估计与自然语言证据摘要,在迭代工具使用循环的每个步骤中由 LLM 更新。这与常见的将所有检索证据追加到不断增长的非结构化上下文的方法相对立。(2) 分层多试验聚合:运行 KK 个独立试验,并使用带数据依赖先验的逻辑空间平均收缩进行组合。(3) 分层校准:带分层先验的 Platt 比例化,避免对来源基准率偏斜的极端预测进行过度收缩。在 ForecastBench 评分榜的 400 个问题上,BLF 超过了所有顶级公共方法,包括 Cassi、GPT-5、Grok~4.20 和 Foresight-32B。通过使用混合效应分析进行严谨的消除实验(控制了问题可变性,这在性能中占 62% 的方差),我们发现所有 3 个组成部分都为整体提升贡献,但某些组成部分的重要性取决于基准 LLM 和环境(例如,是否包含众包先验)。我们的所有实验都基于我们发展出的稳健背测试框架进行,该框架的漏报率低于 1.5%,可能独具兴趣。

关键词

引用

@article{arxiv.2604.18576,
  title  = {Agentic Forecasting using Sequential Bayesian Updating of Linguistic Beliefs},
  author = {Kevin Murphy},
  journal= {arXiv preprint arXiv:2604.18576},
  year   = {2026}
}

备注

v3 fixes an error in the baseline numbers (results for main method unaffected), adds cross-LLM experiments, and improves the presentation