中文

推理模型机器翻译的测试时间扩展

计算与语言 2026-01-13 v2

摘要

测试时间扩展(TTS)已提升了推理模型(RM)在数学和编码等各类任务上的性能,但其在机器翻译(MT)中的效果仍鲜有探讨。本文考察了推理时间计算是否提升翻译质量。我们评估了12种推理模型在多个领域的MT基准测试中,检验三种场景:直接翻译、强制推理外推和后编辑。我们的发现表明,对于通用推理模型,TTS在直接翻译方面仅提供有限且不一致的益处,性能迅速趋于平台期。然而,随着领域特定微调使推理过程与任务要求一致,TTS的有效性得以释放,导致推理深度达到最佳值时表现稳定提升。我们还发现,迫使模型超出自然停止点进行推理会持续降低翻译质量。相反,TTS在后编辑情境中效果显著,可可靠地将自我纠正转化为有益的过程。这些结果表明,推理时间计算在MT中的价值不在于通过通用模型增强单次翻译,而在于针对性应用,如多步骤自我纠错工作流程以及与任务专用模型的结合。

关键词

引用

@article{arxiv.2510.06471,
  title  = {Test-Time Scaling of Reasoning Models for Machine Translation},
  author = {Zihao Li and Shaoxiong Ji and Jörg Tiedemann},
  journal= {arXiv preprint arXiv:2510.06471},
  year   = {2026}
}