面向开放域问答的关系引导预训练
计算与语言
2021-09-22 v1 机器学习
摘要
回答复杂的开放域问题需要理解所涉及实体之间的潜在关系。然而,我们发现现有的问答数据集在某些关系类型上极度不平衡,这损害了在具有长尾关系的问题上的泛化性能。为补救这一问题,本文提出一种关系引导预训练(RGPT-QA)框架。我们首先从 Wikidata 三元组和 Wikipedia 超链接生成覆盖广泛关系的关联问答数据集。然后预训练一个问答模型以从问题中推断潜在关系,并进行抽取式问答以获取目标答案实体。我们证明,通过所提出的 RGPT-QA 技术进行预训练,流行的开放域问答模型 Dense Passage Retriever(DPR)在 Natural Questions、TriviaQA 和 WebQuestions 上的精确匹配准确率分别实现了 2.2%、2.4% 和 6.3% 的绝对提升。特别地,我们展示了 RGPT-QA 在具有长尾关系的问题上显著提升。
引用
@article{arxiv.2109.10346,
title = {Relation-Guided Pre-Training for Open-Domain Question Answering},
author = {Ziniu Hu and Yizhou Sun and Kai-Wei Chang},
journal= {arXiv preprint arXiv:2109.10346},
year = {2021}
}