大语言模型在自动译后编辑中是否真正受益于更长上下文?
计算与语言
2026-03-13 v3 人机交互
摘要
自动译后编辑(APE)旨在通过纠正残余错误来优化机器翻译。尽管近期的大语言模型(LLM)展示了强大的翻译能力,但它们在 APE 中的有效性——尤其是在文档级上下文下——仍未被充分理解。我们在朴素的文档级提示设置下,对专有和开源权重的 LLM 进行了系统比较,分析了 APE 质量、上下文行为、鲁棒性和效率。我们的结果表明,即使使用简单的单样本提示,无论是否提供文档上下文,专有 LLM 都能达到接近人类水平的 APE 质量。虽然这些模型对数据投毒攻击表现出比开源权重模型更高的鲁棒性,但这种鲁棒性也揭示了一个局限性:它们在很大程度上未能利用文档级上下文进行上下文纠错。此外,标准的自动指标并不能可靠地反映这些质量提升,凸显了人工评估的持续必要性。尽管性能强劲,但专有 LLM 的显著成本和延迟开销使其在现实世界的 APE 部署中不切实际。总的来说,我们的发现阐明了基于 LLM 的文档感知 APE 的前景和当前局限性,并指出了为翻译优化开发更高效的长上下文建模方法的必要性。
引用
@article{arxiv.2601.19410,
title = {Do LLMs Truly Benefit from Longer Context in Automatic Post-Editing?},
author = {Ahrii Kim and Seong-heum Kim},
journal= {arXiv preprint arXiv:2601.19410},
year = {2026}
}