基于字典引导的微调与强化学习提高低资源翻译:西班牙语到瓦伊纳基语研究
计算与语言
2025-08-28 v1 人工智能
摘要
低资源机器翻译仍是大型语言模型 (LLMs) 面临的重大挑战,这些模型在预训练期间往往缺乏这些语言的曝光,且在微调时缺乏有限的平行数据。我们提出了一种新方法,通过集成外部词典工具和使用强化学习进行端到端训练来增强低资源语言的翻译能力,除受监督微调外。我们聚焦于西班牙语到瓦伊纳基语的语言对,将翻译建模为可选择性地在生成过程中查询双语词典的工具增强决策问题。该方法将监督指令调优与 Guided Reward Policy Optimization (GRPO) 结合起来,使模型能够学习有效地何时以及如何使用工具。采用 BLEU 相似度得分作为奖励以引导这一学习过程。初步结果表明,我们的工具增强模型在西班牙语到瓦伊纳基语测试集上(来自AmericasNLP 2025 共享任务),相较于先前工作提升最高可达 +3.37 BLEU,相较于无词典访问的监督基线提升 18%。我们还进行消融研究,评估模型架构和训练策略的影响,将 Qwen2.5-0.5B-Instruct 与其他模型(如 LLaMA 和以前的 NLLB-based 系统)进行比较。这些发现凸显了将 LLMs 与外部工具结合以及强化学习在提升低资源语言翻译质量方面的潜力。
引用
@article{arxiv.2508.19481,
title = {Improving Low-Resource Translation with Dictionary-Guided Fine-Tuning and RL: A Spanish-to-Wayuunaiki Study},
author = {Manuel Mosquera and Melissa Robles and Johan Rodriguez and Ruben Manrique},
journal= {arXiv preprint arXiv:2508.19481},
year = {2025}
}