多跳问答中的失效模式:最弱环节效应与识别瓶颈
人工智能
2026-04-22 v2 机器学习
摘要
尽管大型语言模型(LLM)已扩展到 massive context windows,但在多跳推理中仍难以克服位置偏差导致的隐含问题,使得其忽略特定位置的信息。这些失败是源于无法定位证据(识别失败)还是整合证据(综合失败)尚不明确。我们引入Multi-Focus Attention Instruction(MFAI),这是一种语义探针,通过显式引导注意力聚焦于特定位置来分离这些机制。我们在两种多跳问答任务(MuSiQue和NeoQA)上测试了5种LLM,识别出“最弱环节效应”:在18文档、3段落设置下,多跳推理性能坍缩为最少可见证据的水平,由绝对位置而非事实间线性距离决定。虽然匹配的MFAI可解决识别瓶颈,使低可见位置准确率提升最高可达11.49%,但误导性的MFAI在任务拓扑结构下产生差异化效应:以实体为中心、具有垂直推理链的任务较为脆弱,而以事件为中心、具有水平证据结构的任务则更具韧性。最后,我们展示利用System-2推理的思考模型能够有效定位并整合所需信息,即使在噪声环境和长上下文设置下,也能与仅使用金标准的基线相当。补充实验在2WikiMultiHopQA、扩展3-4跳计数以及32B模型上均证实了这些发现可推广至数据集、推理深度和模型规模。
引用
@article{arxiv.2601.12499,
title = {Failure Modes in Multi-Hop QA: The Weakest Link Effect and the Recognition Bottleneck},
author = {Meiru Zhang and Zaiqiao Meng and Nigel Collier},
journal= {arXiv preprint arXiv:2601.12499},
year = {2026}
}
备注
Accepted at ACL 2026