数据有限时的卢森堡语文本生成模型:平衡的多语言策略
计算与语言
2024-12-23 v2
摘要
本文聚焦于开发少数语言模型的挑战,具体关注卢森堡语。尽管卢森堡语的开发活跃,但面临数字数据匮乏,这在卢森堡的多语言环境中尤为突出。我们提出了一种基于 T5 架构的新型文本生成模型,将有限的卢森堡语数据与等量大小和类型的德语和法语数据相结合。我们假设,针对卢森堡语、德语和法语进行训练的模型会提高其跨语言迁移学习能力,并优于单语言和大规模多语言模型。为验证这一假设,本研究探讨了多语言训练是否比单语言训练更有利于卢森堡语的语言生成。为评估,我们引入了 LuxGen,这是首个针对卢森堡语的文本生成基准。
引用
@article{arxiv.2412.09415,
title = {Text Generation Models for Luxembourgish with Limited Data: A Balanced Multilingual Strategy},
author = {Alistair Plum and Tharindu Ranasinghe and Christoph Purschke},
journal= {arXiv preprint arXiv:2412.09415},
year = {2024}
}
备注
Accepted at VarDial 2025