分析多跳问答中底层推理任务的有效性
计算与语言
2023-02-14 v1
摘要
为解释预测答案并评估模型的推理能力,若干研究在多跳问答(QA)数据集中利用了底层推理(UR)任务。然而,当以端到端方式在两类任务上训练模型时,UR 任务对 QA 任务的有效性如何,仍是一个开放问题。在本研究中,我们从三个方面分析 UR 任务(包括句子级与实体级任务)的有效性来解决该问题:(1)QA 性能,(2)推理捷径,以及(3)鲁棒性。尽管先前模型未曾在实体级推理预测任务上显式训练,我们构建了一个多任务模型,同时执行三项任务:句子级支撑事实预测、实体级推理预测与答案预测。在 2WikiMultiHopQA 和 HotpotQA-small 数据集上的实验结果表明:(1)UR 任务能提升 QA 性能。利用新创建的四个去偏数据集,我们证明(2)UR 任务有助于防止多跳 QA 任务中的推理捷径。然而,我们发现(3)UR 任务无助于提升模型在对抗性问题(如子问题与反向问题)上的鲁棒性。我们鼓励未来研究以自然语言问题形式(例如子问题形式)探究实体级推理的有效性。
引用
@article{arxiv.2302.05963,
title = {Analyzing the Effectiveness of the Underlying Reasoning Tasks in Multi-hop Question Answering},
author = {Xanh Ho and Anh-Khoa Duong Nguyen and Saku Sugawara and Akiko Aizawa},
journal= {arXiv preprint arXiv:2302.05963},
year = {2023}
}
备注
Accepted by EACL 2023 (Findings)