在使用 COMET metric 中的常见陷阱与展望
计算与语言
2024-10-01 v3
摘要
COMET metric 在机器翻译社区中取得了显著的成功,由于其强烈的相关性与人类翻译质量判断相吻合。其成功源于是对预训练多语言模型进行微调以进行质量评估的修改版本。然而,作为机器学习模型,COMET 也引发了一组可能不为人知的新陷阱。我们从三个方面探讨这些意外行为:1)技术层面:过时的软件版本和计算精度;2)数据层面:测试时空内容、语言不匹配、翻译ese 以及训练中的分布和领域偏差;3)用法与报告:多参考支持和文献中的模型引用。所有这些问题都意味着 COMET 分数在论文之间甚至在不同技术配置下都不可比较,我们提出了解决每个问题的看法。此外,我们发布了 sacreCOMET 软件包,可以生成软件和模型配置的签名以及适当的引用。本工作旨在帮助社区更仔细地使用 COMET metric。
关键词
引用
@article{arxiv.2408.15366,
title = {Pitfalls and Outlooks in Using COMET},
author = {Vilém Zouhar and Pinzhen Chen and Tsz Kin Lam and Nikita Moghe and Barry Haddow},
journal= {arXiv preprint arXiv:2408.15366},
year = {2024}
}