迷失于字面主义:监督训练如何塑造 LLM 中的翻译腔
计算与语言
2025-03-07 v1
摘要
大语言模型 (LLM) 在机器翻译中取得了显著成功,在多种语言上展示了令人印象深刻的表现。然而,翻译腔——以过于字面和自然的翻译为特征——仍然是基于 LLM 的翻译系统中的持久挑战。尽管它们在大量自然语言语料上进行了预训练,LLM 仍表现出翻译腔错误并生成意外的不自然翻译,这源于监督微调 (SFT) 期间引入的偏差。在本工作中,我们系统地评估了 LLM 生成翻译中翻译腔的普遍性,并研究了其在监督训练期间的根源。我们提出了缓解这些偏差的方法,包括打磨金标准参考译文和过滤不自然的训练实例。经验评估表明这些方法显著减少了翻译腔并提升了翻译自然度,通过人工评估和自动指标进行了验证。我们的发现强调了需要针对训练进行调整以优化 LLM 翻译输出,为更流畅且与目标语言一致的翻译铺平道路。我们在 https://github.com/yafuly/LLM_Translationese 发布了数据和代码。
引用
@article{arxiv.2503.04369,
title = {Lost in Literalism: How Supervised Training Shapes Translationese in LLMs},
author = {Yafu Li and Ronghao Zhang and Zhilin Wang and Huajian Zhang and Leyang Cui and Yongjing Yin and Tong Xiao and Yue Zhang},
journal= {arXiv preprint arXiv:2503.04369},
year = {2025}
}
备注
19 pages;