中文

自动机器翻译指标评估中的数据方差研究

计算与语言 2022-04-21 v2 机器学习

摘要

当前指标评估的实践聚焦于单一数据集,例如每年 WMT Metrics Shared Task 的 Newstest 数据集。然而,本文从定性与定量两个角度表明,指标的性能对数据敏感。当在不同数据集上进行评估时,指标的排序会发生变化。随后,本文进一步考察了两个潜在的假设,即不显著的数据点以及独立同分布(i.i.d)假设的偏离,它们可能是导致数据方差问题的原因。总之,我们的发现表明,在评估自动翻译指标时,研究者应将数据方差纳入考量,并对在单一数据集上得出的结论保持谨慎,因为这可能会与其他大多数数据集上的结果不一致。

关键词

引用

@article{arxiv.2203.15858,
  title  = {Investigating Data Variance in Evaluations of Automatic Machine Translation Metrics},
  author = {Jiannan Xiang and Huayang Li and Yahui Liu and Lemao Liu and Guoping Huang and Defu Lian and Shuming Shi},
  journal= {arXiv preprint arXiv:2203.15858},
  year   = {2022}
}

备注

Findings of ACL 2022