预训练跨语言语言模型的无监督域适应
计算与语言
2020-11-24 v1
摘要
近期研究表明,在大规模无标注文本上预训练跨语言语言模型可显著提升多种跨语言和低资源任务的性能。通过对一百种语言和数 TB 文本的训练,跨语言语言模型已被证明能有效地利用高资源语言来增强低资源语言处理,并优于单语模型。在本文中,我们进一步研究当预训练跨语言语言模型需要适应新领域时的跨语言跨域(CLCD)设定。具体而言,我们提出一种新颖的无监督特征分解方法,在给定源语言无标注原始文本的情况下,能从纠缠的预训练跨语言表示中自动提取领域特定特征和领域不变特征。我们提出的模型利用互信息估计将跨语言模型计算的表示分解为领域不变和领域特定部分。实验结果表明,我们提出的方法在 CLCD 设定下相比最先进的预训练跨语言语言模型取得了显著的性能提升。本文源代码公开于 https://github.com/lijuntaopku/UFD。
引用
@article{arxiv.2011.11499,
title = {Unsupervised Domain Adaptation of a Pretrained Cross-Lingual Language Model},
author = {Juntao Li and Ruidan He and Hai Ye and Hwee Tou Ng and Lidong Bing and Rui Yan},
journal= {arXiv preprint arXiv:2011.11499},
year = {2020}
}