BLEURT 存在通用翻译:基于最小风险训练的自动评价指标分析
计算与语言
2023-07-11 v2
摘要
自动评价指标在机器翻译中起着至关重要的作用。尽管基于 n-gram 的指标被广泛使用,但近年来聚焦于衡量句子语义的预训练模型指标发展迅速。然而,这些神经指标虽然与人类评估的相关性更高,却常被视为难以察觉潜在偏见的黑箱。本研究从其对机器翻译系统训练的引导作用出发,系统分析并比较了多种主流与前沿的自动评价指标。通过最小风险训练(Minimum Risk Training, MRT),我们发现某些指标存在鲁棒性缺陷,例如 BLEURT 和 BARTScore 中存在通用对抗翻译。深入分析表明,这些鲁棒性不足主要源于两方面:训练数据集中的分布偏差,以及指标范式本身的倾向性。通过引入 token 级约束,我们增强了评价指标的鲁棒性,进而提升了机器翻译系统的性能。代码见 \url{https://github.com/powerpuffpomelo/fairseq_mrt}。
引用
@article{arxiv.2307.03131,
title = {BLEURT Has Universal Translations: An Analysis of Automatic Metrics by Minimum Risk Training},
author = {Yiming Yan and Tao Wang and Chengqi Zhao and Shujian Huang and Jiajun Chen and Mingxuan Wang},
journal= {arXiv preprint arXiv:2307.03131},
year = {2023}
}
备注
Accepted to ACL 2023 main conference