开放域问答中的有害上下文
计算与语言
2023-10-30 v1 人工智能
摘要
对于知识密集型 NLP 任务,广泛认为获取更多信息是提升模型端到端性能的一个因素。然而,反直觉的是,在常见问答(QA)数据集上评估时,过多上下文会对模型产生负面影响。本文分析了在问答中使用的检索后阅读架构下,段落如何产生有害影响。我们的经验证据表明,当前的阅读架构未能充分利用检索到的段落,并且与使用子集相比,在使用完整段落时性能显著下降。我们的发现表明,通过过滤掉有害段落,在两个流行 QA 数据集上模型准确率可提升 10%,且这些结果是通过使用现有检索方法而无需进一步训练或数据达成的。我们进一步强调了识别有害段落相关的挑战。首先,即便有正确上下文,模型也可能做出错误预测,这给确定哪些段落最具影响力带来困难。其次,评估通常考虑词汇匹配,而其对正确答案的变体不够鲁棒。尽管存在这些局限,我们的实验结果强调了在上下文高效的检索后阅读流程中识别并移除这些有害段落的关键作用。代码与数据可在 https://github.com/xfactlab/emnlp2023-damaging-retrieval 获取。
引用
@article{arxiv.2310.18077,
title = {Detrimental Contexts in Open-Domain Question Answering},
author = {Philhoon Oh and James Thorne},
journal= {arXiv preprint arXiv:2310.18077},
year = {2023}
}
备注
Findings of EMNLP 2023