中文

抑郁症神经影像研究中机器学习性能的系统误估

神经元与认知 2021-06-23 v2 计算机视觉与模式识别 图像与视频处理

摘要

我们目前在精神病学机器学习研究中观察到一种令人不安的现象:尽管我们预期更大的样本由于更多数据的可用性而产生更好的结果,但更大规模的机器学习研究一致显示出比众多小规模研究弱得多的性能。在此,我们系统性地研究了这一效应,聚焦于该领域研究最广泛的问题之一,即基于神经影像数据对患有重性抑郁障碍(MDD)的患者与健康对照(HC)进行分类。利用来自我们近期国际预测分析竞赛(PAC)的平衡样本(N=1,868N = 1,868 名 MDD 患者和 HC)的结构磁共振成像(MRI)数据,我们首先在完整数据集上训练并测试了一个分类模型,其准确率为 61%61\,\%。接下来,我们模拟了研究者从总体中抽取各种大小样本(N=4N = 4N=150N = 150)的过程,并展示了误估的极高风险。具体而言,对于小样本量(N=20N = 20),我们观察到高达 95%95\,\% 的准确率。对于中等样本量(N=100N = 100)发现了高达 75%75\,\% 的准确率。重要的是,进一步研究表明,足够大的测试集能有效防止性能误估,而更大的数据集本身并不能。尽管这些结果质疑了当前文献中相当大一部分的有效性,我们提出了相对低成本的补救办法,即更大的测试集,这在大多数情况下易于实现。

关键词

引用

@article{arxiv.1912.06686,
  title  = {Systematic Misestimation of Machine Learning Performance in Neuroimaging Studies of Depression},
  author = {Claas Flint and Micah Cearns and Nils Opel and Ronny Redlich and David M. A. Mehler and Daniel Emden and Nils R. Winter and Ramona Leenings and Simon B. Eickhoff and Tilo Kircher and Axel Krug and Igor Nenadic and Volker Arolt and Scott Clark and Bernhard T. Baune and Xiaoyi Jiang and Udo Dannlowski and Tim Hahn},
  journal= {arXiv preprint arXiv:1912.06686},
  year   = {2021}
}