中文

图像分类流水线中计算步骤、算法与超参数选择的误差贡献量化

计算机视觉与模式识别 2019-03-07 v1 机器学习 机器学习

摘要

数据科学依赖于以相互依赖的计算步骤形式组织的流水线。每个步骤包含可用于执行特定功能的各种候选算法。每种算法包含若干超参数。算法与超参数必须作为一个整体进行优化以产生最佳性能。典型的机器学习流水线通常在每个步骤中包含复杂算法。不仅选择过程是组合式的,而且解释和理解这些流水线也很重要。我们提出一种方法,通过相对于该层中算法的不可知选择计算误差贡献,来量化流水线中不同层的重要性。我们在图像分类流水线上演示了我们的方法。该不可知方法量化了图像分类流水线中计算步骤、算法和超参数的误差贡献。我们表明,算法选择和超参数优化方法可用于量化误差贡献,且随机搜索比贝叶斯优化能更准确地量化贡献。该方法论可被领域专家用来从各个组成部分的角度理解机器学习和数据分析流水线,从而有助于对流水线的不同组件进行优先级排序。

关键词

引用

@article{arxiv.1903.02521,
  title  = {Quantifying error contributions of computational steps, algorithms and hyperparameter choices in image classification pipelines},
  author = {Aritra Chowdhury and Malik Magdin-Ismail and Bulent Yener},
  journal= {arXiv preprint arXiv:1903.02521},
  year   = {2019}
}

备注

arXiv admin note: substantial text overlap with arXiv:1903.00405