中文

分割方式至关重要:纵向脑 MRI 分析中的数据泄漏与受试者特征研究

图像与视频处理 2025-05-12 v1 计算机视觉与模式识别

摘要

深度学习模型已革新医学图像分析领域,为改进诊断与病患照护带来重大前景。然而,由于称为“数据泄漏”的隐性陷阱,其性能可能被误导而显得过于乐观。本研究中,我们调查 3D 医学影像中的数据泄漏,具体使用 3D 卷积神经网络(CNNs)进行脑 MRI 分析。尽管 3D CNNs 看似比 2D 对应模型更不易泄漏,但交叉验证(CV)期间不当的数据划分仍可能引发问题,尤其对于含同一受试者重复扫描的纵向影像数据。我们探究不同数据划分策略对纵向脑 MRI 分析模型性能的影响,并识别潜在的数据泄漏隐患。GradCAM 可视化有助于揭示由身份混淆导致的 CNN 模型捷径,即模型在学习诊断特征的同时学会了识别受试者。我们的发现与先前研究一致,强调了按受试者划分以及在来自不同受试者的保留数据上进一步评估模型的重要性,以确保深度学习模型在医学图像分析中的完整性与可靠性。

关键词

引用

@article{arxiv.2309.00350,
  title  = {How You Split Matters: Data Leakage and Subject Characteristics Studies in Longitudinal Brain MRI Analysis},
  author = {Dewinda Julianensi Rumala},
  journal= {arXiv preprint arXiv:2309.00350},
  year   = {2025}
}

备注

submitted to MICCAI FAIMI 2023