MERIT: 多专家奖励感知微调用于面向中文的低资源机器翻译
计算与语言
2026-04-07 v1
摘要
从中文到低资源东南亚语言的神经机器翻译(NMT)仍然受到干净平行语料极度匮乏以及现有挖掘数据中普遍存在的噪声的严重制约。这种长期短缺不仅阻碍了有效的模型训练,还维持了与高资源方向之间巨大的性能差距,尽管大型多语言模型近期取得了进展,但老挝语、缅甸语和他加禄语等数百万使用者仍然面临着持续低质量的翻译系统。我们提出了多专家奖励感知微调(MERIT),一个统一的翻译框架,将传统的以英语为中心的 ALT 基准转变为面向五种东南亚低资源语言(LRL)的以中文为中心的评估套件。我们的框架结合了语言特定令牌前缀(LTP)、监督微调(SFT)以及由语义对齐奖励(SAR)引导的新型组相对策略优化(GRPO)。这些结果证实,在 LRL→Chinese 翻译中,有针对性的数据策展和奖励引导优化远远优于单纯的模型扩展。
引用
@article{arxiv.2604.04839,
title = {MERIT: Multilingual Expert-Reward Informed Tuning for Chinese-Centric Low-Resource Machine Translation},
author = {Zhixiang Lu and Chong Zhang and Chenyu Xue and Angelos Stefanidis and Chong Li and Jionglong Su and Zhengyong Jiang},
journal= {arXiv preprint arXiv:2604.04839},
year = {2026}
}