中文

致力于了解何时不知道:将不确定性作为结构推理中的控制信号

人工智能 2025-09-03 v1

摘要

大型语言模型(LLM)代理在结构化生物医学数据环境中日益部署,但在处理复杂多表格数据时常常生成流畅而自信过度的输出。我们引入一种不确定性感知代理,用于查询条件下的多表格总结,该方法利用两种互补信号:(i)检索不确定性——基于多个表选择 rollout 的熵;(ii)总结不确定性——结合自洽性和 perplexity。将总结不确定性纳入强化学习(RL)框架中的 Group Relative Policy Optimization(GRPO),而两种不确定性均指导推理时间过滤,并支持构建更高质量的合成数据集。在多组学基准测试中,我们的方法在事实性和校准性方面均取得改进,使每个总结中正确且有用主张的数量几乎翻了三倍(3.0→8.4 内部;3.6→9.9 癌症多组学),并在下游生存预测中取得显著提升(C-index 0.32→0.63)。这些结果表明,不确定性可作为控制信号——使代理能够中止、传达置信度,并成为复杂结构化数据环境中更可靠工具的关键因素。

关键词

引用

@article{arxiv.2509.02401,
  title  = {Towards Agents That Know When They Don't Know: Uncertainty as a Control Signal for Structured Reasoning},
  author = {Josefa Lia Stoisser and Marc Boubnovski Martell and Lawrence Phillips and Gianluca Mazzoni and Lea Mørch Harder and Philip Torr and Jesper Ferkinghoff-Borg and Kaspar Martens and Julien Fauqueur},
  journal= {arXiv preprint arXiv:2509.02401},
  year   = {2025}
}