中文

优于平均:NLP 系统的配对评估

计算与语言 2021-10-22 v1 人工智能

摘要

NLP 中的评估通常通过比较相互竞争的系统在共同测试实例集上独立平均的分数来完成。在这项工作中,我们质疑使用平均值将评估分数聚合为用于决定哪个系统最佳的最终数值,因为平均值以及中位数等替代方案忽略了系统在同一测试实例上评估所产生的配对关系。我们阐明了考虑评估分数的实例级配对的重要性,并从理论和经验上展示了基于成对比较的聚合方法(如 Bradley-Terry (BT) 模型,一种基于给定系统在测试集上得分优于另一系统的估计概率的机制)的优势。通过重新评估跨越四项任务和 18 个评估指标的 296 个真实 NLP 评估设置,我们表明聚合机制的选择至关重要,并在约 30% 的设置中对哪些系统为最先进(state of the art)得出不同结论。为促进配对评估的采用,我们发布了一个实用工具,可使用均值、中位数、BT 以及 BT 的两种变体(Elo 和 TrueSkill)对评估分数进行完整分析,并附带适当的统计检验功能。

关键词

引用

@article{arxiv.2110.10746,
  title  = {Better than Average: Paired Evaluation of NLP Systems},
  author = {Maxime Peyrard and Wei Zhao and Steffen Eger and Robert West},
  journal= {arXiv preprint arXiv:2110.10746},
  year   = {2021}
}

备注

Published in ACL 2021 (long paper)