中文

低资源语言机器翻译的高效方法:以越南语-中文为例

计算与语言 2025-02-03 v1

摘要

尽管近年来神经网络在机器翻译中取得了进展,但当训练数据不足时,这些网络的效果并不理想。本文针对越南语-中文等低资源语言,提出了一种机器翻译方法。该方法利用了多语言预训练语言模型(mBART)以及越南语和中文的单语语料库。首先,我们使用双语训练数据集构建了一个早期机器翻译模型。其次,我们采用TF-IDF技术从单语语料库中选取与平行数据集领域最相关的句子。最后,利用第一个模型从选定的单语语料库中合成增强训练数据,用于翻译模型。我们的方案相比Transformer模型性能提升了8%。增强数据集也进一步推动了模型性能的提升。

关键词

引用

@article{arxiv.2501.19314,
  title  = {An Efficient Approach for Machine Translation on Low-resource Languages: A Case Study in Vietnamese-Chinese},
  author = {Tran Ngoc Son and Nguyen Anh Tu and Nguyen Minh Tri},
  journal= {arXiv preprint arXiv:2501.19314},
  year   = {2025}
}

备注

Technical report of VLSP 2022 NMT; The first two authors contributed equally to this work