中文

多跳问答中的掩码:语言模型在上下文置换下的表现分析

计算与语言 2025-05-20 v1

摘要

多跳问答 (Multi-hop Question Answering, MHQA) 为问答任务增加了层次复杂性,使其更具挑战性。当语言模型 (Language Models, LMs) 以多个搜索结果为提示时,除了需要检索相关信息外,还需在信息源之间进行多跳推理。尽管语言模型在传统问答任务中表现良好,但因果掩码可能阻碍其在复杂上下文中的推理能力。本文我们通过对搜索结果(检索文档)进行置换,在 various 配置下探讨语言模型对多跳问题的响应方式。我们的研究发现:1)编码器-解码器模型,如 Flan-T5 系列模型,在MHQA任务中总体优于因果解码器-only 模型,尽管规模显著较小;2)改变黄金文档的顺序在 Flan T5 模型和微调的解码器-only 模型中均显示出不同趋势,当文档顺序与推理链顺序一致时性能最佳;3)通过修改因果掩码以增强双向注意力,可有效提升因果解码器-only 模型的终端性能。除上述内容外,我们还深入调查了语言模型在MHQA情境下的注意力权重分布。我们的实验表明,当最终答案正确时,注意力权重倾向于达到更高的值。我们利用这一发现来对语言模型在该任务上的性能进行启发式改进。我们的代码已公开于 https://github.com/hwy9855/MultiHopQA-Reasoning。

关键词

引用

@article{arxiv.2505.11754,
  title  = {Masking in Multi-hop QA: An Analysis of How Language Models Perform with Context Permutation},
  author = {Wenyu Huang and Pavlos Vougiouklis and Mirella Lapata and Jeff Z. Pan},
  journal= {arXiv preprint arXiv:2505.11754},
  year   = {2025}
}

备注

ACL 2025 main