机器学习评估与基准测试的挑战与陷阱
机器学习
2019-06-26 v2 人工智能
软件工程
摘要
越来越多复杂且多样的机器学习(ML)模型以及硬件/软件栈(统称为“ML 制品”)被提出,形成了多样化的 ML 格局。这些提出的 ML 创新已超出研究者分析、研究和适配它们的能力。复杂的、有时不可复现的 ML 评估流程使这一问题更加严重。共享 ML 制品的常见做法是通过代码仓库,作者发布临时代码与部分文档,但往往未披露他人复现结果所需的关键信息。这导致用户无法与作者的声明进行比较,也无法将模型适配到自己的用途。本文讨论 ML 评估与基准测试的常见挑战与陷阱,可作为 ML 模型作者共享制品时以及系统开发者基准测试或设计 ML 系统时的指南。
引用
@article{arxiv.1904.12437,
title = {Challenges and Pitfalls of Machine Learning Evaluation and Benchmarking},
author = {Cheng Li and Abdul Dakkak and Jinjun Xiong and Wen-mei Hwu},
journal= {arXiv preprint arXiv:1904.12437},
year = {2019}
}