中文

利用蒸馏句子表示进行低资源语言的双语文本挖掘

计算与语言 2022-05-26 v1

摘要

将多语言表示学习扩展到一百种最频繁语言之外具有挑战性,尤其是覆盖低资源语言的长尾。一种有前景的方法是训练一个全能多语言模型以实现跨语言迁移,但这些模型常受限于容量不足以及不相关语言间的干扰。相反,我们脱离该方法,专注于训练多种语言(族)特定表示,但最重要的是使所有语言仍能在同一表示空间中编码。为此,我们聚焦于师生训练,使所有编码器在双语文本挖掘上相互兼容,并支持新语言的快速学习。我们引入了一种结合监督与自监督训练的新师生训练方案,使编码器能利用单语训练数据,这在低资源环境下十分宝贵。我们的方法显著优于原始 LASER 编码器。我们研究了极低资源语言并处理了 50 种非洲语言,其中许多未被任何其他模型覆盖。对于这些语言,我们训练了句子编码器、挖掘了双语文本,并通过训练 NMT 系统验证了这些双语文本。

关键词

引用

@article{arxiv.2205.12654,
  title  = {Bitext Mining Using Distilled Sentence Representations for Low-Resource Languages},
  author = {Kevin Heffernan and Onur Çelebi and Holger Schwenk},
  journal= {arXiv preprint arXiv:2205.12654},
  year   = {2022}
}

备注

12 pages