面向以中文为中心的低资源语言神经机器翻译的改进
计算与语言
2025-03-26 v1
摘要
过去十年见证了科技巨大进步,刺激了各国经济与文化交往日益增长的需求。构建神经机器翻译(NMT)系统已成为紧迫趋势,尤其在低资源场景下。然而,近期工作倾向于研究以英语为中心的低资源语言 NMT 系统,而少有工作关注以其他语言(如中文)为中心的低资源 NMT 系统。为此,2021 年 iFLYTEK AI 开发者竞赛的低资源多语翻译挑战赛提供了以中文为中心的多语低资源 NMT 任务,要求参与者基于所提供的低资源样本构建 NMT 系统。本文给出该竞赛的冠军系统,其利用了单语词嵌入数据增强、双语课程学习以及对比重排序。此外,提出一种新的不完全信任(In-trust)损失函数,在训练时替代传统的交叉熵损失。实验结果表明,这些思路的实现取得了优于其他先进方法的性能。所有实验代码发布于:https://github.com/WENGSYX/Low-resource-text-translation。
引用
@article{arxiv.2204.04344,
title = {Towards Better Chinese-centric Neural Machine Translation for Low-resource Languages},
author = {Bin Li and Yixuan Weng and Fei Xia and Hanjun Deng},
journal= {arXiv preprint arXiv:2204.04344},
year = {2025}
}
备注
7pages, 4 figures, 4 tables