机器阅读理解中的协同自训练
计算与语言
2022-06-29 v3 人工智能
摘要
预训练语言模型通过提供高质量的上下文词嵌入,显著提升了包括抽取式问答在内的下游语言理解任务性能。然而,训练问答模型仍需要大量特定领域的标注数据。本工作中,我们提出一种协同自训练框架 RGX,用于自动生成更多非平凡问答对以提升模型性能。RGX 构建于掩码答案抽取任务之上,具有一个包含答案实体识别器、问题生成器和答案抽取器的交互式学习环境。给定一段带有掩码实体的文本,生成器围绕该实体生成问题,抽取器被训练为利用所生成问题与原始文本抽取该掩码实体。该框架允许在任何文本语料上无需标注地训练问题生成与回答模型。实验结果表明,RGX 在标准问答基准上优于最先进的(SOTA)预训练语言模型与迁移学习方法,并在给定模型规模与迁移学习设定下取得新的 SOTA 性能。
引用
@article{arxiv.2103.07449,
title = {Cooperative Self-training of Machine Reading Comprehension},
author = {Hongyin Luo and Shang-Wen Li and Mingye Gao and Seunghak Yu and James Glass},
journal= {arXiv preprint arXiv:2103.07449},
year = {2022}
}
备注
NAACL 2022