中文

对用于衡量人工智能进展的指标的批判性分析

人工智能 2021-11-09 v2 机器学习

摘要

在基准数据集上比较模型性能是衡量和推动人工智能进展的重要组成部分。模型在基准数据集上的性能通常基于单一或少量性能指标来评估。虽然这便于快速比较,但如果指标未能充分覆盖所有性能特征,则可能带来不能充分反映模型性能的风险。这种影响在多大程度上会波及基准测试工作尚属未知。为解答此问题,我们基于涵盖开放仓库“Papers with Code”中 3867 项机器学习模型性能结果的数据,分析了当前的性能指标格局。结果表明,当前使用的绝大多数指标具有可能导致对模型性能反映不充分的性质。尽管已提出解决这些问题的替代指标,但它们目前很少被使用。此外,我们描述了所报告指标中的模糊性,这可能导致解释和比较模型性能时的困难。

关键词

引用

@article{arxiv.2008.02577,
  title  = {A critical analysis of metrics used for measuring progress in artificial intelligence},
  author = {Kathrin Blagec and Georg Dorffner and Milad Moradi and Matthias Samwald},
  journal= {arXiv preprint arXiv:2008.02577},
  year   = {2021}
}