多跳阅读器是否梦见了推理链?
计算与语言
2019-11-01 v1
摘要
基于文本的一般问答(QA)系统需要多跳推理能力,即利用从多个段落中收集的信息进行推理以得出答案的能力。在本文中,我们进行了系统分析,以评估现有多种为多跳 QA 任务提出的模型的此类能力。具体而言,我们的分析考察了:提供多个段落的完整推理链,而非仅提供答案出现的最终段落,是否能提升现有 QA 模型的性能。令人惊讶的是,当使用额外的证据段落时,所有现有多跳阅读方法的提升都相当有限,其中 BERT 模型在 F1 上的最高错误率降低为 5.8%(对应 1.3% 的绝对提升)。为了更好地理解推理链是否确实有助于找到正确答案,我们进一步开发了一种基于共匹配的方法,当应用于我们的两个基础阅读器(包括 BERT)时,使用段落链实现了 13.1% 的错误率降低。我们的结果展示了利用显式多跳推理存在潜在改进,以及开发具有更强推理能力模型的必要性。
引用
@article{arxiv.1910.14520,
title = {Do Multi-hop Readers Dream of Reasoning Chains?},
author = {Haoyu Wang and Mo Yu and Xiaoxiao Guo and Rajarshi Das and Wenhan Xiong and Tian Gao},
journal= {arXiv preprint arXiv:1910.14520},
year = {2019}
}
备注
Accepted by MRQA Workshop 2019