MultiSlav:利用跨语言知识传递抵御多语言化诅咒
计算与语言
2025-02-21 v1
摘要
多语言神经机器翻译(NMT)是否导致“多语言化诅咒”,或者在语言族内部提供跨语言知识传递?本研究探索了多种扩展NMT可用数据规模的方法,并证明即使在零样本翻译场景下,低资源语言也能获得跨语言益处。本文提供了用于翻译所选斯拉夫语之间语言的领先开源NMT模型。我们将模型发布在HuggingFace Hub(https://hf.co/collections/allegro/multislav-6793d6b6419e5963e759a683)下CC BY 4.0许可证。斯拉夫语族包含形态丰富的中东欧语言。尽管拥有数亿母语者,斯拉夫语神经机器翻译仍被鄙视。最近,大多数NMT研究要么关注像英语、西班牙语和德语语等高资源语言——在WMT23通用翻译任务中,7个8个任务方向来自或指向英语;要么关注覆盖多个语言群的大规模多语言模型;或关注评估技术。
引用
@article{arxiv.2502.14509,
title = {MultiSlav: Using Cross-Lingual Knowledge Transfer to Combat the Curse of Multilinguality},
author = {Artur Kot and Mikołaj Koszowski and Wojciech Chojnowski and Mieszko Rutkowski and Artur Nowakowski and Kamil Guttmann and Mikołaj Pokrywka},
journal= {arXiv preprint arXiv:2502.14509},
year = {2025}
}