DeepTrans:基于强化学习的深度推理翻译
计算与语言
2025-09-01 v2 人工智能
摘要
最近,深度推理LLM(如OpenAI o1和DeepSeek-R1)在各种下游任务中展现出前景的性能。自由翻译是多语言世界中重要且有趣的任务,需要超越逐词翻译。然而,该任务在深度推理LLM中仍属探索不足。在本文中,我们引入DeepTrans,这是一个通过强化学习(RL)学习自由翻译的深度推理翻译模型。具体而言,我们构建了一个奖励模型,基于翻译结果和思维过程中预定义的评分标准。该奖励模型教导DeepTrans在RL期间如何思考和自由翻译给定句子。此外,我们的RL训练不需要任何标记翻译,避免了人工密集标注或资源密集型数据合成。实验结果表明DeepTrans的有效性。以Qwen2.5-7B为骨干,DeepTrans在文学翻译中性能提升16.3%,并超过了强大的深度推理LLM。此外,我们总结了在RL探索期间的失败情况和有趣发现。我们希望本工作能够激发其他研究人员在自由翻译方面的努力。
引用
@article{arxiv.2504.10187,
title = {DeepTrans: Deep Reasoning Translation via Reinforcement Learning},
author = {Jiaan Wang and Fandong Meng and Jie Zhou},
journal= {arXiv preprint arXiv:2504.10187},
year = {2025}
}
备注
Accepted by Transactions of the Association for Computational Linguistics (TACL)