预训练上下文语言模型的跨语言迁移
计算与语言
2021-07-28 v1
摘要
尽管预训练上下文语言模型(PrLM)对自然语言处理(NLP)产生了重大影响,但在英语以外的语言上训练 PrLM 可能因两个原因而不切实际:其他语言通常缺乏足以训练强大 PrLM 的语料库,并且由于人类语言之间的共性,针对不同语言进行计算代价高昂的 PrLM 训练在某种程度上是冗余的。在这项工作中,基于近期将跨语言模型迁移与神经机器翻译相联系的研究,我们提出了一种用于 PrLM 的新型跨语言模型迁移框架:TreLM。为处理语言间的符号顺序和序列长度差异,我们提出了一种中间的“TRILayer”结构,该结构从这些差异中学习,并在我们的主要翻译方向上创建更好的迁移,同时提出了一种新的用于迁移训练的跨语言语言建模目标。此外,我们展示了一种嵌入对齐方法,该方法以对抗方式使 PrLM 的非上下文嵌入空间和 TRILayer 结构适应以学习跨语言的文本转换网络,从而解决语言间的词汇差异。在语言理解和结构解析任务上的实验表明,所提框架在性能和效率上均显著优于用有限数据从头训练的语料模型。此外,尽管在资源丰富的场景下与从头预训练相比性能损失微不足道,我们的跨语言模型迁移框架在经济性上显著更优。
引用
@article{arxiv.2107.12627,
title = {Cross-lingual Transferring of Pre-trained Contextualized Language Models},
author = {Zuchao Li and Kevin Parnow and Hai Zhao and Zhuosheng Zhang and Rui Wang and Masao Utiyama and Eiichiro Sumita},
journal= {arXiv preprint arXiv:2107.12627},
year = {2021}
}