中文

面向阅读理解的无监督域自适应

计算与语言 2020-07-28 v5 机器学习

摘要

阅读理解(RC)已在多种数据集上得到研究,深度神经网络带来了性能的提升。然而,这些模型跨领域的泛化能力仍不明确。为缓解该问题,我们研究 RC 上的无监督域自适应,其中模型在带标签的源域上训练,并应用于仅有未带标签样本的目标域。我们首先表明,即使使用强大的 BERT 上下文表示,当在一个数据集上训练的模型直接应用于另一个目标数据集时,性能仍不尽如人意。为此,我们提出一种新颖的条件对抗自训练方法(CASe)。具体而言,我们的方法利用在源数据集上微调的 BERT 模型并结合置信度过滤,在目标域中生成可靠的伪标签样本用于自训练。另一方面,它通过跨域的条件对抗学习进一步减小域分布差异。大量实验表明,我们的方法在多个大规模基准数据集上取得了与有监督模型相当的准确率。

关键词

引用

@article{arxiv.1911.06137,
  title  = {Unsupervised Domain Adaptation on Reading Comprehension},
  author = {Yu Cao and Meng Fang and Baosheng Yu and Joey Tianyi Zhou},
  journal= {arXiv preprint arXiv:1911.06137},
  year   = {2020}
}

备注

8 pages, 6 figures, 5 tables, Accepted by AAAI 2020