BLEU遇见COMET:结合词汇与神经度量实现鲁棒机器翻译评估
计算与语言
2023-05-31 v1
摘要
尽管基于神经网络的机器翻译评估度量(如COMET或BLEURT)已实现对人类判断的强相关性,它们有时在检测某些可视为关键错误的现象(如实体与数字偏差)上并不可靠。相比之下,传统评估度量(如BLEU或chrF)衡量翻译假设与人类参考间的词汇或字符重叠,虽与人类判断相关性较低,却对此类偏差敏感。本文中,我们探究结合这两种方法的若干途径,以提升最先进评估方法对含关键错误翻译的鲁棒性。我们表明,通过在训练中使用额外信息(如句子级特征与词级标签),所训练度量增强了惩罚具特定棘手现象翻译的能力,从而在与人类判断的相关性上及在多种语言对的近期挑战集上取得提升。
引用
@article{arxiv.2305.19144,
title = {BLEU Meets COMET: Combining Lexical and Neural Metrics Towards Robust Machine Translation Evaluation},
author = {Taisiya Glushkova and Chrysoula Zerva and André F. T. Martins},
journal= {arXiv preprint arXiv:2305.19144},
year = {2023}
}
备注
Accepted at EAMT 2023