中文

基于BERT的评估指标的可复现性问题

计算与语言 2022-10-28 v3 机器学习

摘要

可复现性在机器学习和自然语言处理(NLP)中至关重要。在自然语言生成领域(尤其是机器翻译),Post(2018)的开创性论文指出了当时主导指标BLEU的可复现性问题。如今,基于BERT的评估指标大幅优于BLEU。在本文中,我们探究近期四种基于BERT的指标的结果与主张是否可被复现。我们发现,主张与结果的复现常常失败,原因在于:(i) 指标中涉及大量未文档化的预处理;(ii) 代码缺失;(iii) 对基线指标报告了较弱的结果;(iv) 在一个案例中,问题源于并非与人类评分相关,而是与csv文件中错误的列相关,使分数虚高5分。受预处理影响的启发,我们随后开展了第二项研究,更仔细地考察其影响(针对其中一个指标)。我们发现预处理可能产生较大影响,尤其是对于高度屈折语言。在此情况下,预处理的影响可能大于聚合机制(例如贪心对齐 vs. 词移距离)的影响。

关键词

引用

@article{arxiv.2204.00004,
  title  = {Reproducibility Issues for BERT-based Evaluation Metrics},
  author = {Yanran Chen and Jonas Belouadi and Steffen Eger},
  journal= {arXiv preprint arXiv:2204.00004},
  year   = {2022}
}

备注

EMNLP 2022 Camera-Ready (captions fixed)