中文

MultiSlav:利用跨语言知识传递抵御多语言化诅咒

计算与语言 2025-02-21 v1

摘要

多语言神经机器翻译(NMT)是否导致“多语言化诅咒”,或者在语言族内部提供跨语言知识传递?本研究探索了多种扩展NMT可用数据规模的方法,并证明即使在零样本翻译场景下,低资源语言也能获得跨语言益处。本文提供了用于翻译所选斯拉夫语之间语言的领先开源NMT模型。我们将模型发布在HuggingFace Hub(https://hf.co/collections/allegro/multislav-6793d6b6419e5963e759a683)下CC BY 4.0许可证。斯拉夫语族包含形态丰富的中东欧语言。尽管拥有数亿母语者,斯拉夫语神经机器翻译仍被鄙视。最近,大多数NMT研究要么关注像英语、西班牙语和德语语等高资源语言——在WMT23通用翻译任务中,7个8个任务方向来自或指向英语;要么关注覆盖多个语言群的大规模多语言模型;或关注评估技术。

关键词

引用

@article{arxiv.2502.14509,
  title  = {MultiSlav: Using Cross-Lingual Knowledge Transfer to Combat the Curse of Multilinguality},
  author = {Artur Kot and Mikołaj Koszowski and Wojciech Chojnowski and Mieszko Rutkowski and Artur Nowakowski and Kamil Guttmann and Mikołaj Pokrywka},
  journal= {arXiv preprint arXiv:2502.14509},
  year   = {2025}
}