大型语言模型是否能在不依赖捷径的情况下进行潜在多跳推理
计算与语言
2025-06-03 v2
摘要
我们评估大型语言模型(LLMs)在回答此类多跳查询时的潜在事实记忆和组合能力,例如:“斯卡莱特·约什诉诞生的那年,夏季奥运会是在哪个国家举办的”。此类评估的主要挑战之一是,LLMs可能通过遇到查询中提及的实体“斯卡莱特·约什诉”和答案实体“美国”等训练序列来开发捷径,或者仅仅基于基于频率的先验进行猜测。为防止捷径,我们排除了头实体和答案实体可能在训练期间共现的测试查询。通过对关系和事实进行严格挑选,并系统性地移除模型可能猜测答案或利用部分匹配的情况,我们构建了一个SOCRATES(ShOrtCut-fRee lATent rEaSoning)评估数据集。我们观察到,LLMs在不依赖捷径的情况下展现出有前景的潜在多跳推理能力,但仅限于特定类型的查询。对于需要潜在记忆国家作为中间答案的查询,最佳模型实现了80%的潜在可组合性,但这一比例在记忆年份时仅为5%。与链式思考方法的比较显示,模型在潜在推理与显式推理之间存在显著差距。分析结果表明,潜在中间答案的表示在潜在可组合性较高的查询中更常被构建,并且显示出在预训练期间潜在多跳推理能力的出现。
引用
@article{arxiv.2411.16679,
title = {Do Large Language Models Perform Latent Multi-Hop Reasoning without Exploiting Shortcuts?},
author = {Sohee Yang and Nora Kassner and Elena Gribovskaya and Sebastian Riedel and Mor Geva},
journal= {arXiv preprint arXiv:2411.16679},
year = {2025}
}
备注
Findings of ACL 2025