低资源语言机器翻译的高效方法:以越南语-中文为例
计算与语言
2025-02-03 v1
摘要
尽管近年来神经网络在机器翻译中取得了进展,但当训练数据不足时,这些网络的效果并不理想。本文针对越南语-中文等低资源语言,提出了一种机器翻译方法。该方法利用了多语言预训练语言模型(mBART)以及越南语和中文的单语语料库。首先,我们使用双语训练数据集构建了一个早期机器翻译模型。其次,我们采用TF-IDF技术从单语语料库中选取与平行数据集领域最相关的句子。最后,利用第一个模型从选定的单语语料库中合成增强训练数据,用于翻译模型。我们的方案相比Transformer模型性能提升了8%。增强数据集也进一步推动了模型性能的提升。
引用
@article{arxiv.2501.19314,
title = {An Efficient Approach for Machine Translation on Low-resource Languages: A Case Study in Vietnamese-Chinese},
author = {Tran Ngoc Son and Nguyen Anh Tu and Nguyen Minh Tri},
journal= {arXiv preprint arXiv:2501.19314},
year = {2025}
}
备注
Technical report of VLSP 2022 NMT; The first two authors contributed equally to this work