信息检索式问答中的挑战:不可回答问题与段落检索
计算与语言
2021-06-08 v2
摘要
近期的预训练语言模型“解决”了许多阅读理解基准,其中问题是在能够访问证据文档的情况下写出的。然而,包含信息检索式查询的数据集(证据文档在查询独立写出后才被提供)仍然具有挑战性。我们在 Natural Questions 和 TyDi QA 上分析了为何回答信息检索式查询更具挑战性,以及其普遍存在的不可回答性从何而来。我们的受控实验指出了两个提升空间——段落选择和可回答性预测,即配对的证据文档是否包含查询的答案。当提供黄金段落并知晓何时拒答时,现有模型轻松超越人类标注者。然而,预测可回答性本身仍具挑战性。我们手动标注了六种语言下 800 个不可回答示例,分析其难以回答的原因。利用这一新数据,我们进行了按类别的可回答性预测,揭示了当前数据集收集及任务定义中的问题。总之,我们的研究为信息检索式问答的未来研究指明了方向,涵盖数据集创建与模型开发。
引用
@article{arxiv.2010.11915,
title = {Challenges in Information-Seeking QA: Unanswerable Questions and Paragraph Retrieval},
author = {Akari Asai and Eunsol Choi},
journal= {arXiv preprint arXiv:2010.11915},
year = {2021}
}
备注
Published as a conference paper at ACL 2021 (long). Our code and annotated data are publicly available at https://github.com/AkariAsai/unanswerable_qa