中文

理解多跳推理中的数据集设计选择

计算与语言 2019-04-30 v1 人工智能

摘要

学习多跳推理一直是阅读理解模型的一个关键挑战,这促使了明确聚焦于该任务的数据集的设计。理想情况下,若不进行多跳推理,模型不应在多跳问答任务上表现良好。在本文中,我们研究了两个近期提出的数据集,WikiHop 和 HotpotQA。首先,我们探讨了针对这些任务的句子分解模型;按设计,这些模型无法进行多跳推理,但它们仍能在两个数据集中解决大量样本。此外,我们在 WikiHop 的未掩码版本中发现了伪相关,使得仅考虑问题和答案即可轻松取得高性能。最后,我们考察了这些数据集之间的一个关键差异,即问答任务的基于片段与多项选择形式。两个数据集的多项选择版本都容易被投机取巧地攻破,我们所考察的两个模型在此设定下仅勉强超过基线。总体而言,尽管这些数据集是有用的测试平台,但高性能模型可能并未像先前认为的那样学到那么多多跳推理。

关键词

引用

@article{arxiv.1904.12106,
  title  = {Understanding Dataset Design Choices for Multi-hop Reasoning},
  author = {Jifan Chen and Greg Durrett},
  journal= {arXiv preprint arXiv:1904.12106},
  year   = {2019}
}

备注

NAACL 2019