中文

多跳问答是否处于脱节推理状态?度量并降低断开式推理

计算与语言 2020-11-18 v3 人工智能 机器学习

摘要

多跳问答是否取得了真正的进展?模型常常利用数据集伪影来给出正确答案,而未跨多个支撑事实建立信息关联。这限制了我们度量真实进展的能力,也违背了构建多跳问答数据集的初衷。我们为此作出三点贡献。首先,我们将此类不良行为形式化为跨支撑事实子集的脱节推理(disconnected reasoning)。由此可开发一种与模型无关的探针,用于度量任何模型通过脱节推理作弊的程度。其次,利用\emph{对比支撑充分性}(contrastive support sufficiency)这一概念,我们引入了对现有数据集的自动转换方法,以降低脱节推理的量。第三,我们的实验表明,在阅读理解设定下的多跳问答并未取得太多进展。对于一个近期的大规模模型(XLNet),我们显示其在 HotpotQA 上 72 的回答 F1 分数中仅有 18 分是通过多事实推理获得的,与一个简单的 RNN 基线大致相同。我们的转换显著降低了脱节推理(回答 F1 达 19 分)。它与对抗方法互补,结合使用时可进一步降低。

关键词

引用

@article{arxiv.2005.00789,
  title  = {Is Multihop QA in DiRe Condition? Measuring and Reducing Disconnected Reasoning},
  author = {Harsh Trivedi and Niranjan Balasubramanian and Tushar Khot and Ashish Sabharwal},
  journal= {arXiv preprint arXiv:2005.00789},
  year   = {2020}
}

备注

Accepted at EMNLP'20