中文

解构 ML 驱动科学中的过度乐观与 publication bias

机器学习 2024-07-15 v3 人工智能 计算机与社会

摘要

机器学习 (ML) 正在跨越许多学科,取得令人瞩目的报告性结果。然而,近期研究表明,已发表 ML 模型的性能往往过度乐观。有效性问题体现在已发表 ML 模型报告准确率与样本量呈现逆相关,这与学习曲线理论相矛盾——准确率应随样本量增加而提高或保持稳定。本文调查 ML 驱动科学中导致乐观主义的因素,重点关注过拟合和 publication bias。我们引入了一个新颖的随机模型,用于观察准确率,将参数化学习曲线与上述偏差相结合。我们构建了一个纠正这些偏差的观测数据估计器。理论和实证结果表明,我们的框架可以估计底层学习曲线,提供来自已发表结果的真实绩效评估。将该模型应用于神经学条件分类的 meta-分析,我们估计了每个领域基于 ML 的预测的内在限制。

关键词

引用

@article{arxiv.2405.14422,
  title  = {Unraveling overoptimism and publication bias in ML-driven science},
  author = {Pouria Saidi and Gautam Dasarathy and Visar Berisha},
  journal= {arXiv preprint arXiv:2405.14422},
  year   = {2024}
}

备注

31 pages, 7 figures, 6 tables