R1-T1:通过推理学习完全激励 LLM 的翻译能力
计算与语言
2025-05-27 v3
摘要
尽管近期在增强推理能力的大型语言模型(LLM)方面取得了突破(如 DeepSeek-R1),但将推理时间推理纳入机器翻译(MT)中尚未得到充分探索——人类翻译家自然会采用结构化、多层次的推理链式思维(CoTs)。现有方法要么设计针对特定 MT 子任务(如文学翻译)的固定 CoT,要么依赖不符合人类认知的 CoT 合成以及易产生过拟合的监督微调(SFT),限制了其对多样化翻译情景的适应性。本文介绍了 R1-Translator(R1-T1),一种 novel 框架,通过强化学习(RL)实现通用机器翻译的推理时间推理,其中人类对齐的 CoTs 包含六种常见模式。我们的方法首次实现了三项创新:(1)将基于推理的翻译扩展到更广泛的 MT 情景(如多语言翻译、领域翻译),这些情景在训练阶段未被涵盖;(2)形式化六种专家精选的 CoT 模板,模拟人类策略的混合策略,如情境感知的改写和逆向翻译;(3)通过 RL 实现自演化 CoT 发现。人类和自动评估结果表明,在 Flores-101 测试集以及四个领域特定 MT 任务中,本方法在 10+ 种语言和 40+ 种翻译方向上实现了持续的翻译性能提升,尤其在训练期间未出现的语言上表现尤为突出。
引用
@article{arxiv.2502.19735,
title = {R1-T1: Fully Incentivizing Translation Capability in LLMs via Reasoning Learning},
author = {Minggui He and Yilun Liu and Shimin Tao and Yuanchang Luo and Hongyong Zeng and Chang Su and Li Zhang and Hongxia Ma and Daimeng Wei and Weibin Meng and Hao Yang and Boxing Chen and Osamu Yoshie},
journal= {arXiv preprint arXiv:2502.19735},
year = {2025}
}