扩展多语言预训练模型的子词模型以适配新语言
计算与语言
2022-11-30 v1
摘要
多语言预训练模型因在单一模型中包含多种语言,对机器翻译与跨语言处理十分有效。然而,它们是在分词器固定之后才进行预训练的;因此预训练后难以更改词表。当我们将预训练模型扩展到新语言时,必须同时修改分词器。在本文中,我们向 SentencePiece 分词器添加新子词,以将多语言预训练模型应用于新语言(本文中为因纽特语)。在我们的实验中,我们在不改变已预训练语言分词方式的情况下将因纽特语句子切分为子词,并将 mBART-50 预训练模型应用于英语-因纽特语翻译。
引用
@article{arxiv.2211.15965,
title = {Extending the Subwording Model of Multilingual Pretrained Models for New Languages},
author = {Kenji Imamura and Eiichiro Sumita},
journal= {arXiv preprint arXiv:2211.15965},
year = {2022}
}
备注
Code: https://github.com/kenji-imamura/sentpiece_mimic