Hop、Skip 与 Overthink:诊断推理模型在多跳分析中的失误
计算与语言
2025-08-07 v1 人工智能
摘要
推理模型的出现及其集成到实际 AI 聊天机器人中,使得解决需要复杂多步骤思维过程的先进数学、深度搜索和抽取式问答问题取得了突破。然而,对于这些模型为何比通用语言模型更频繁幻觉仍缺乏完整理解。在本调查研究中,我们系统地探讨了当代语言模型在多跳问答任务中的推理失误。我们引入一种新颖且细致的错误分类框架,检视跨三个关键维度的失误:涉及源文档的多样性和唯一性("hops")、在捕获相关信息方面的完整性("coverage"),以及认知效率("overthinking")。通过严格的人类标注,辅以补充自动化指标,我们的探索揭示了往往被准确率中心评估掩盖的复杂错误模式。这种调查方法提供了对当前模型认知局限性的更深入见解,并为提升未来语言建模 efforts 中的推理忠实性、透明性和鲁棒性提供了可操作的指导。
引用
@article{arxiv.2508.04699,
title = {Hop, Skip, and Overthink: Diagnosing Why Reasoning Models Fumble during Multi-Hop Analysis},
author = {Anushka Yadav and Isha Nalawade and Srujana Pillarichety and Yashwanth Babu and Reshmi Ghosh and Samyadeep Basu and Wenlong Zhao and Ali Nasaeh and Sriram Balasubramanian and Soundararajan Srinivasan},
journal= {arXiv preprint arXiv:2508.04699},
year = {2025}
}