细微数据犯罪:朴素地训练机器学习算法可能导致过于乐观的结果
机器学习
2021-12-15 v3
摘要
尽管开放数据库在深度学习(DL)时代是重要的资源,但它们有时被“非标签使用”:为某一任务发布的数据被用于训练面向不同任务的算法。本工作旨在指出,在某些情况下,这一常见做法可能导致有偏的、过于乐观的结果。我们针对逆问题求解器展示了该现象,并说明其有偏性能源于隐藏的数据预处理流水线。我们描述了开放获取数据库中典型的两种预处理流水线,并研究了它们对三种成熟的磁共振成像(MRI)重建算法的影响:压缩感知(CS)、字典学习(DictL)与 DL。在这项大规模研究中我们进行了大量计算。我们的结果表明,当在看似合适的数据上朴素训练时,CS、DictL 和 DL 算法产生系统性有偏结果:归一化均方根误差(NRMSE)随预处理程度持续改善,在某些情况下出现 25%–48% 的人为提升。由于该现象总体上不为人知,有偏结果有时作为最优(SOTA)发表;我们称之为细微数据犯罪。因此,本工作对大数据朴素非标签使用敲响警钟,并揭示了现代逆问题求解器对此类偏差的脆弱性。
引用
@article{arxiv.2109.08237,
title = {Subtle Data Crimes: Naively training machine learning algorithms could lead to overly-optimistic results},
author = {Efrat Shimron and Jonathan I. Tamir and Ke Wang and Michael Lustig},
journal= {arXiv preprint arXiv:2109.08237},
year = {2021}
}
备注
16 pages, 7 figures, two tables. Submitted to a journal