中文

多跳推理中看似合理的干扰项:大型语言模型是专注的阅读者吗?

计算与语言 2024-11-01 v3 人工智能

摘要

最先进的大型语言模型(LLM)被赋予了越来越多的不同能力,从阅读理解、高级数学和推理技能到掌握科学知识。在本文中,我们重点关注它们的多跳推理能力:从多个文本来源识别和整合信息的能力。鉴于现有的多跳推理基准测试中存在简化线索,使得模型能够规避推理要求,我们着手调查 LLM 是否倾向于利用此类简化线索。我们找到证据表明,它们确实规避了执行多跳推理的要求,但其方式比关于其经过微调的预训练语言模型(PLM)前身的报告更为隐蔽。受此发现启发,我们通过生成看似合理但最终导致错误答案的多跳推理链,提出了一个具有挑战性的多跳推理基准测试。我们评估了多个开源和专有的 SOTA LLM,并发现在面对这些看似合理的替代选项时,它们执行多跳推理的表现受到影响,F1 分数相对下降高达 45%。我们进行了更深入的分析,发现有证据表明,尽管 LLM 倾向于忽略误导性的词汇线索,但误导性的推理路径确实构成了重大挑战。

关键词

引用

@article{arxiv.2409.05197,
  title  = {Seemingly Plausible Distractors in Multi-Hop Reasoning: Are Large Language Models Attentive Readers?},
  author = {Neeladri Bhuiya and Viktor Schlegel and Stefan Winkler},
  journal= {arXiv preprint arXiv:2409.05197},
  year   = {2024}
}

备注

15 pages, 3 figures, EMNLP 2024 Main Conference