语言模型用于阅读理解的无监督域自适应
计算与语言
2020-05-22 v2
摘要
本研究解决阅读理解的无监督域自适应(UDARC)问题。阅读理解(RC)是一项学习利用文本源进行问答能力的任务。RC 上的最先进模型仍不具备通用语言智能;即,其对训练未使用的域外数据集准确率下降。我们假设此差异由域外语言建模(LM)能力缺乏所致。UDARC 任务允许模型使用源域中的有监督 RC 训练数据与目标域中仅无标签篇章。为解决 UDARC 问题,我们提供两种域自适应模型。第一种依次学习域外 LM 与域内 RC 任务。第二种是所提模型,采用 LM 与 RC 的多任务学习方法。这些模型能保留从源域有监督数据获得的 RC 能力,以及从目标域无标签数据获得的 LM 能力。我们在跨五个不同域的 UDARC 上评估了模型。模型优于无域自适应的模型。特别地,所提模型在未见过的生物医学域中 EM/F1 提升了 4.3/4.2 点。
引用
@article{arxiv.1911.10768,
title = {Unsupervised Domain Adaptation of Language Models for Reading Comprehension},
author = {Kosuke Nishida and Kyosuke Nishida and Itsumi Saito and Hisako Asano and Junji Tomita},
journal= {arXiv preprint arXiv:1911.10768},
year = {2020}
}
备注
LREC2020