通过答案多样化实现无监督问答
计算与语言
2022-08-24 v1
摘要
无监督问答因其不依赖标注数据而是一项引人注目的任务。以往工作通常利用启发式规则与预训练模型来构造数据并训练 QA 模型。然而,这些工作大多将命名实体(NE)视为唯一答案类型,忽略了真实世界中答案的高度多样性。为应对该问题,我们提出一种通过多样化答案的新颖无监督方法,称为 DiverseQA。具体而言,所提方法由三个模块组成:数据构造、数据增强与去噪过滤器。首先,数据构造模块将提取的命名实体扩展为更长的句子成分作为新答案片段,以构造具有多样答案的 QA 数据集。其次,数据增强模块通过在嵌入层进行对抗训练,采用依赖于答案类型的数据增强过程。第三,去噪过滤器模块旨在减轻构造数据中的噪声。大量实验表明,所提方法在 SQuADv1.1、NewsQA、TriviaQA、BioASQ 和 DuoRC 五个基准数据集上优于以往无监督模型。此外,所提方法在少样本学习设定下展现出强劲性能。
引用
@article{arxiv.2208.10813,
title = {Unsupervised Question Answering via Answer Diversifying},
author = {Yuxiang Nie and Heyan Huang and Zewen Chi and Xian-Ling Mao},
journal= {arXiv preprint arXiv:2208.10813},
year = {2022}
}
备注
Accepted by COLING 2022