通过将词元映射到共享字符空间训练双语语言模型
计算与语言
2024-02-27 v1 机器学习
摘要
我们使用阿拉伯语文本的希伯来语音译版本训练了一个阿拉伯语-希伯来语双语语言模型,以确保两种语言使用相同的文字表示。鉴于阿拉伯语和希伯来语在形态和结构上的相似性,以及两者共享的大量同源词,我们评估了采用统一文字表示两种语言的语言模型在需要跨语言知识的机器翻译任务上的性能。结果令人鼓舞:我们的模型优于将阿拉伯语文本保留在阿拉伯文字中的对比模型,证明了音译步骤的有效性。尽管训练数据集比其他现有语言模型小约60%,但我们的模型在双向机器翻译中似乎都提供了可比的性能。
引用
@article{arxiv.2402.16065,
title = {Training a Bilingual Language Model by Mapping Tokens onto a Shared Character Space},
author = {Aviad Rom and Kfir Bar},
journal= {arXiv preprint arXiv:2402.16065},
year = {2024}
}