LLM 单次推理在多跳问答中的 Fano 风格准确度上界
人工智能
2026-04-28 v3
摘要
多跳问答(Multi-Hop Question Answering, MHQA)要求在噪声环境下通过顺序推理整合分散且相互关联的证据。这一任务对 LLM 来说具有挑战性,因为它们的单次输出容量有限,超过此容量后,任务相关证据的整合将不可靠。因此,单次推理范式本质上对这种容量溢出极其脆弱。为 formalized this 瓶颈,我们的分析建立了一个 Fano 风格的准确度上界,定义了单次 LLM 的理论性能上限。该上界表明,一旦任务复杂度超过模型容量,准确度必然崩溃,为 LLM 的容量感知表示和结构化提供了一般原则。基于这些原则,我们引入了一个概念证明框架用于 MHQA,InfoQA。它通过结合容量感知的任务分解和主动修剪先前的推理痕迹,以保持信息负荷在单次容量限制内,确保每一步的高准确度。它进一步通过依赖显式工作流程实现鲁棒性, enables precise control over the reasoning path。我们构建了一个严格且充满噪声的基准来验证我们的理论和框架。实验结果表明,模型行为与我们的预测容量曲线一致,而 InfoQA 实现了持续的性能提升。我们希望我们的工作激发更多 LLM 多步骤推理方法的发展。
引用
@article{arxiv.2509.21199,
title = {A Fano-Style Accuracy Upper Bound for LLM Single-Pass Reasoning in Multi-Hop QA},
author = {Kaiyang Wan and Lang Gao and Honglin Mu and Preslav Nakov and Yuxia Wang and Xiuying Chen},
journal= {arXiv preprint arXiv:2509.21199},
year = {2026}
}
备注
22 pages, 6 figures, ICLR 2026. Reported by MIT Technology Review