中文

差分隐私医学图像分析中自监督预训练的作用

计算机视觉与模式识别 2026-01-28 v1 人工智能 机器学习

摘要

差分隐私(DP)为敏感数据提供形式化保护,但通常会导致诊断性能的显著下降。模型初始化已成为缓解这种降解的关键因素,但在完整模型 DP 下,现代自监督学习的作用仍不完全为人所知。本文present了一种针对差分隐私医学图像分析的初始化策略的大规模评估,使用胸部 X 光分类作为代表性基准,包含超过800,000张图像。我们使用在DP-SGD下训练的 state-of-the-art ConvNeXt 模型,跨越真实的隐私范围,比较非领域特定的监督ImageNet初始化、非领域特定的自监督DINOv3初始化以及针对MIMIC-CXR的领域特定监督预训练,该数据集是目前最大公开的胸部 X 光数据集。evaluation在覆盖多样化机构和获取设置的五个外部数据集上进行。我们表明,在DP下,DINOv3初始化在诊断实用性方面始终优于ImageNet初始化,但仍不如领域特定监督预训练,后者实现的性能接近非私有基准。我们进一步演示了初始化选择对人口统计公平性、跨数据集泛化以及对数据规模和模型容量的鲁棒性在隐私约束下具有重要影响。这些结果确立了初始化策略作为差分隐私医学影像中实用性、公平性和泛化性决定因子的中心地位。

关键词

引用

@article{arxiv.2601.19618,
  title  = {The role of self-supervised pretraining in differentially private medical image analysis},
  author = {Soroosh Tayebi Arasteh and Mina Farajiamiri and Mahshad Lotfinia and Behrus Hinrichs-Puladi and Jonas Bienzeisler and Mohamed Alhaskir and Mirabela Rusu and Christiane Kuhl and Sven Nebelung and Daniel Truhn},
  journal= {arXiv preprint arXiv:2601.19618},
  year   = {2026}
}