中文

推理式问答

计算与语言 2026-02-03 v1 信息检索

摘要

尽管在广泛的问答 (QA) 系统领域进行了大量研究,但现有大多数工作集中于答案包含性,即假设答案可以直接从语料库中的文档中提取和/或生成。然而,一些问题需要推理,即从可用信息中推导出答案,但答案并未在文档中明确呈现。我们引入推理式问答 (Inferential QA) ——一种新任务,挑战模型从仅提供线索的答案支持段落中推断答案。为研究此问题,我们构建了 QUIT (QUestions requiring Inference from Texts) 数据集,包含 7,401 个问题和 240 万段落,基于高收敛的人类和机器编写的提示,采用基于 LLM 的可答性和人类验证,对其进行三层次相关性标注。通过对检索器、重排序器和基于 LLM 的阅读器进行全面评估,我们发现在推理式问答中有效的方法在传统 QA 任务上效果不佳:检索器表现不佳,重排序器提升有限,微调提供了不一致的改进。即使是面向推理的 LLM 也未能优于较小的通用模型。这些发现表明,当前的 QA 流水线尚未准备好进行基于推理的推理。推理式问答因此建立了一种新的 QA 任务类别,朝着从间接文本证据进行理解和推理的方向发展。

关键词

引用

@article{arxiv.2602.01239,
  title  = {Inferential Question Answering},
  author = {Jamshid Mozafari and Hamed Zamani and Guido Zuccon and Adam Jatowt},
  journal= {arXiv preprint arXiv:2602.01239},
  year   = {2026}
}

备注

Proceedings of the ACM Web Conference 2026 (WWW 2026)