中文

机器学习评估与基准测试的挑战与陷阱

机器学习 2019-06-26 v2 人工智能 软件工程

摘要

越来越多复杂且多样的机器学习(ML)模型以及硬件/软件栈(统称为“ML 制品”)被提出,形成了多样化的 ML 格局。这些提出的 ML 创新已超出研究者分析、研究和适配它们的能力。复杂的、有时不可复现的 ML 评估流程使这一问题更加严重。共享 ML 制品的常见做法是通过代码仓库,作者发布临时代码与部分文档,但往往未披露他人复现结果所需的关键信息。这导致用户无法与作者的声明进行比较,也无法将模型适配到自己的用途。本文讨论 ML 评估与基准测试的常见挑战与陷阱,可作为 ML 模型作者共享制品时以及系统开发者基准测试或设计 ML 系统时的指南。

关键词

引用

@article{arxiv.1904.12437,
  title  = {Challenges and Pitfalls of Machine Learning Evaluation and Benchmarking},
  author = {Cheng Li and Abdul Dakkak and Jinjun Xiong and Wen-mei Hwu},
  journal= {arXiv preprint arXiv:1904.12437},
  year   = {2019}
}