SMaLL-100:面向低资源语言的浅层多语言机器翻译模型
计算与语言
2023-02-16 v1 人工智能
机器学习
摘要
近年来,多语言机器翻译模型通过共享相似语言之间的信息,在低资源语言对上取得了有前景的性能,从而实现了零样本翻译。为克服“多语言诅咒”,这些模型通常选择扩大参数数量,这使得它们在资源受限环境中的使用具有挑战性。我们介绍了SMaLL-100,它是大规模多语言机器翻译模型M2M-100(12B)的蒸馏版本,覆盖100种语言。我们以所有语言对的均匀采样训练SMaLL-100,因此侧重于保持低资源语言的性能。我们在不同的低资源基准上评估SMaLL-100:FLORES-101、Tatoeba和TICO-19,并证明它优于先前可比规模(200-600M)的大规模多语言模型,同时改善了推理延迟和内存使用。此外,我们的模型取得了与M2M-100(1.2B)相当的结果,而推理时模型小3.6倍、快4.3倍。代码和预训练模型:https://github.com/alirezamshi/small100
引用
@article{arxiv.2210.11621,
title = {SMaLL-100: Introducing Shallow Multilingual Machine Translation Model for Low-Resource Languages},
author = {Alireza Mohammadshahi and Vassilina Nikoulina and Alexandre Berard and Caroline Brun and James Henderson and Laurent Besacier},
journal= {arXiv preprint arXiv:2210.11621},
year = {2023}
}
备注
Accepted to EMNLP 2022