中文

基于可验证奖励的强化学习以激励参数化知识用于跨文化实体翻译

计算与语言 2026-04-21 v1 人工智能

摘要

大型语言模型(LLM)在跨文化实体翻译中仍面临挑战,由于字面或音译方式通常无法在语境中获得文化上恰当的翻译。然而,相关知识可能已经在大规模预训练期间编码在模型参数中。为激励有效利用参数化知识,我们提出了 EA-RLVR(Entity-Anchored Reinforcement Learning with Verifiable Rewards),即一种无需依赖外部知识库即可优化跨文化实体翻译的训练框架。EA-RLVR 将监督信号锚定在可验证的实体级别奖励信号上,并纳入轻量级结构门以稳定优化。这一设计引导模型学习健壮的推理过程,而不仅仅是模仿参考翻译。我们在 XC-Translate 上评估了 EA-RLVR,观察到实体翻译准确率和跨域泛化能力均得到一致提升。具体而言,仅使用 7k 样本的训练即可使 Qwen3-14B 在由 5 万个完全未见实体组成的测试集上的实体翻译准确率从 23.66% 提升至 31.87%。所学到的实体翻译能力也可迁移到通用翻译,使 XCOMET 提升 1.35 分,在进一步优化后可达 +1.59。对 pass@kpass@k 动力学和奖励函数形式的广泛分析将这些收益归因于更优的采样效率和稳定的优化景观。

关键词

引用

@article{arxiv.2604.16881,
  title  = {Incentivizing Parametric Knowledge via Reinforcement Learning with Verifiable Rewards for Cross-Cultural Entity Translation},
  author = {Jiang Zhou and Xiaohu Zhao and Xinwei Wu and Tianyu Dong and Hao Wang and Yangyang Liu and Heng Liu and Linlong Xu and Longyue Wang and Weihua Luo and Deyi Xiong},
  journal= {arXiv preprint arXiv:2604.16881},
  year   = {2026}
}

备注

23 pages, 11 figures, 11 tables