隐私、公平与准确:在医学影像中训练大规模隐私保护 AI 模型
图像与视频处理
2024-03-19 v5 人工智能
密码学与安全
计算机视觉与模式识别
机器学习
摘要
人工智能(AI)模型在医学领域的应用日益增多。然而,由于医学数据高度敏感,需要采取特殊防护措施以确保其安全。隐私保护的金标准是在模型训练中引入差分隐私(DP)。先前的研究表明,DP 会对模型准确性和公平性产生负面影响,这在医学中是不可接受的,也是隐私保护技术广泛应用的主要障碍。在本工作中,我们评估了与非隐私训练相比,AI 模型的隐私保护训练在准确性和公平性方面的影响。为此,我们使用了两个数据集:(1)一个高质量临床胸部 X 射线的大数据集(N=193,311),以及(2)一个 3D 腹部计算机断层扫描(CT)图像数据集(N=1,625),任务为分类是否存在胰腺导管腺癌(PDAC)。两者均为回顾性收集并由经验丰富的放射科医生手动标注。随后,我们比较了非隐私深度卷积神经网络(CNN)与隐私保护(DP)模型,以受试者工作特征曲线下面积(AUROC)衡量的隐私-效用权衡,以及以皮尔逊相关系数 r 或统计 parity 差异(Statistical Parity Difference)衡量的隐私-公平性权衡。我们发现,尽管隐私保护训练得到的准确性较低,但其基本未放大对年龄、性别或合并症的歧视。我们的研究表明,在真实临床数据集的严峻现实条件下,诊断性深度学习模型的隐私保护训练能够以优异的诊断准确性和公平性实现。
引用
@article{arxiv.2302.01622,
title = {Private, fair and accurate: Training large-scale, privacy-preserving AI models in medical imaging},
author = {Soroosh Tayebi Arasteh and Alexander Ziller and Christiane Kuhl and Marcus Makowski and Sven Nebelung and Rickmer Braren and Daniel Rueckert and Daniel Truhn and Georgios Kaissis},
journal= {arXiv preprint arXiv:2302.01622},
year = {2024}
}
备注
Published in Communications Medicine. Nature Portfolio