利用序列到序列预训练语言模型的迁移学习实现巴拿语-越南语翻译以构建文化桥梁
计算与语言
2025-05-19 v1
摘要
本工作探索了实现巴拿语-越南语翻译的历程,旨在为越南的两个民族群体构建文化桥梁。然而,从巴拿语翻译到越南语也遇到了一些困难。最突出的挑战是缺乏可用的原始巴拿语资源,包括词汇、语法、对话模式和双语语料库,这阻碍了训练数据的收集过程。为了解决这个问题,我们利用序列到序列预训练语言模型的迁移学习方法。首先,我们利用预训练的越南语语言模型来捕捉该语言的特征。特别是,为了进一步服务于机器翻译的目的,我们旨在使用序列到序列模型,而非像BERT这样的仅编码器模型或像GPT这样的仅解码器模型。利用两种语言之间的显著相似性,我们使用当前有限的越南语-巴拿语双语文本资源继续训练模型,以执行从语言模型到机器翻译的迁移学习。因此,这种方法有助于处理两种语言之间资源不平衡的问题,同时优化训练和计算过程。此外,我们还使用数据增强技术扩充数据集以生成额外资源,并定义了一些启发式方法以帮助翻译更精确。我们的方法已被验证对巴拿语-越南语翻译模型非常有效,有助于语言的扩展和保护,并促进两个民族之间更好的相互理解。
引用
@article{arxiv.2505.11421,
title = {Towards Cultural Bridge by Bahnaric-Vietnamese Translation Using Transfer Learning of Sequence-To-Sequence Pre-training Language Model},
author = {Phan Tran Minh Dat and Vo Hoang Nhat Khang and Quan Thanh Tho},
journal= {arXiv preprint arXiv:2505.11421},
year = {2025}
}