xCOMET:通过细粒度错误检测实现透明的机器翻译评估
计算与语言
2023-10-17 v1
摘要
广泛使用的机器翻译评估学习型指标,如COMET和BLEURT,通过提供单一的句子级分数来估计翻译假设的质量。因此,它们很少能揭示翻译错误(例如,错误是什么及其严重程度)。另一方面,生成式大语言模型(LLMs)正在扩大更细粒度评估策略的采用,试图详述并归类翻译错误。在本工作中,我们引入xCOMET,一种开源学习型指标,旨在弥合上述方法之间的差距。xCOMET集成了句子级评估与错误跨度检测能力,在所有类型的评估(句子级、系统级和错误跨度检测)中均展现出最先进的性能。此外,它还能高亮并归类错误跨度,从而丰富质量评估。我们还通过压力测试提供了鲁棒性分析,并表明xCOMET在很大程度上能够识别局部关键错误和幻觉。
引用
@article{arxiv.2310.10482,
title = {xCOMET: Transparent Machine Translation Evaluation through Fine-grained Error Detection},
author = {Nuno M. Guerreiro and Ricardo Rei and Daan van Stigt and Luisa Coheur and Pierre Colombo and André F. T. Martins},
journal= {arXiv preprint arXiv:2310.10482},
year = {2023}
}
备注
Work in progress