NIPS——甚至不算错?机器学习与人工智能文献中算法有效性实证完备性演示的系统综述
机器学习
2018-12-19 v1 人工智能
机器学习
摘要
目的:在确定当前ML/AI监督学习文献样本中得出算法有效性结论所需的论证步骤完备性。数据来源:发表于神经信息处理系统(NeurIPS,原名NIPS)期刊且官方记录显示2017年出版的论文。入选标准:报告(半)监督模型,或将预处理与(半)监督模型融合用于表格数据的研究。研究评估:三名评审员应用评估标准确定论证完备性。标准分为三组,包括:实验(如实体和/或合成数据)、基线(如未知情和/或最先进)以及定量比较(如带置信区间的性能量化指标及算法与基线的形式化比较)。结果:在121篇合格手稿(来自679篇摘要样本)中,99%使用真实世界数据,29%使用合成数据。91%的手稿未报告未知情基线,55%报告了最先进基线。32%报告了性能置信区间,但无一提供这些区间如何计算的参考文献或说明。3%报告了形式化比较。局限性:使用单一期刊作为主要信息源可能不能代表所有ML/AI文献。然而,NeurIPS会议被公认为处于ML/AI研究顶尖行列,故将其语料视为高质量研究的代表是合理的。结论:以2017年NeurIPS监督学习语料样本作为当前ML/AI研究质量与可信度的指示,似乎算法有效性演示中的完整论证链十分罕见。
引用
@article{arxiv.1812.07519,
title = {NIPS - Not Even Wrong? A Systematic Review of Empirically Complete Demonstrations of Algorithmic Effectiveness in the Machine Learning and Artificial Intelligence Literature},
author = {Franz J Király and Bilal Mateen and Raphael Sonabend},
journal= {arXiv preprint arXiv:1812.07519},
year = {2018}
}