领域不匹配并不总是阻碍跨语言迁移学习
计算与语言
2022-12-01 v1
摘要
在没有标注目标语言数据或平行文本的情况下,跨语言迁移学习在零样本跨语言分类、问答、无监督机器翻译等方面取得了出人意料的有效性。然而,近期的一些发表文献声称领域不匹配会阻碍跨语言迁移,其结果表明,当底层的单语语料库来自不同领域时(例如,法语文本来自维基百科,而英语文本来自联合国会议记录),无监督双语词典归纳(UBLI)和无监督神经机器翻译(UNMT)效果不佳。在这项工作中,我们表明简单的初始化机制可以克服跨语言迁移中大部分由领域不匹配带来的影响。我们在拼接的领域不匹配语料库上预训练词嵌入和上下文嵌入,并将其作为三个任务的初始化:MUSE UBLI、UN Parallel UNMT 以及 SemEval 2017 跨语言词相似度任务。在所有情况下,我们的结果都表明,适当的初始化可以恢复由领域不匹配造成的大部分损失,从而挑战了先前工作的结论。
引用
@article{arxiv.2211.16671,
title = {Domain Mismatch Doesn't Always Prevent Cross-Lingual Transfer Learning},
author = {Daniel Edmiston and Phillip Keung and Noah A. Smith},
journal= {arXiv preprint arXiv:2211.16671},
year = {2022}
}
备注
8 pages, 1 figure. Published/presented at LREC (2022)