相同评估,更多令牌:输入长度对使用大型语言模型进行机器翻译评估的影响
计算与语言
2025-10-06 v2
摘要
准确评估机器翻译文本仍然是一个长期挑战,尤其对于长文档而言。近期研究表明,大型语言模型(LLMs)可以通过MQM错误跨度标注,作为可靠且可解释的句子级翻译评估器。随着现代LLMs支持更大的上下文窗口,一个自然的问题随之而来:我们能否将整个文档翻译输入到LLM中进行质量评估?理想情况下,评估应对文本长度保持不变,无论输入粒度如何,都能产生一致的错误跨度。然而,我们的分析表明,文本长度显著影响评估:更长的文本导致更少的错误跨度和更低的系统排名准确率。为了解决这一局限性,我们评估了几种策略,包括粒度对齐提示、焦点句子提示(FSP)以及一种微调方法,以更好地使LLMs与评估任务对齐。后两种方法在很大程度上缓解了这种长度偏差,使LLMs在长文本翻译评估中更加可靠。
引用
@article{arxiv.2505.01761,
title = {Same evaluation, more tokens: On the effect of input length for machine translation evaluation using Large Language Models},
author = {Tobias Domhan and Dawei Zhu},
journal= {arXiv preprint arXiv:2505.01761},
year = {2025}
}
备注
Accepted at EMNLP 2025 (Main Conference)