MQM-APE:面向 LLM 翻译评估器中高质量错误标注预测器的自动后编辑
计算与语言
2024-12-17 v2
摘要
大型语言模型(LLM)作为机器翻译(MT)质量评估的评判者展现出了巨大的潜力,能够提供评分和细粒度的反馈。尽管诸如 GEMBA-MQM 等方法在无参考评估上展现出了最先进的性能,但预测的错误与人类标注的错误之间缺乏良好的一致性,限制了其作为反馈信号的可解释性。为了提高 LLM 评估器预测的错误标注质量,我们引入了一个通用且无需训练的框架 ,其核心思想是通过基于每个错误对原始翻译进行自动后编辑(APE)来过滤掉无影响的错误,仅保留那些有助于质量提升的错误。具体而言,我们提示 LLM 扮演 1) 以提供错误标注,2) 以确定错误是否影响质量提升,以及 3) 作为错误过滤器。实验表明,在涵盖高资源和低资源语言的八个 LLM 上,我们的方法在错误跨度的可靠性和质量上始终优于 GEMBA-MQM。与基于训练的方法正交,MQM-APE 补充了诸如 Tower 等特定翻译评估器,突出了其广泛的适用性。进一步的分析证实了每个模块的有效性,并为评估器设计和 LLM 选择提供了有价值的见解。
引用
@article{arxiv.2409.14335,
title = {MQM-APE: Toward High-Quality Error Annotation Predictors with Automatic Post-Editing in LLM Translation Evaluators},
author = {Qingyu Lu and Liang Ding and Kanjian Zhang and Jinxia Zhang and Dacheng Tao},
journal= {arXiv preprint arXiv:2409.14335},
year = {2024}
}
备注
COLING 2025