中文

使用合成数据的隐私保护癌症分类实用性提升

计算机视觉与模式识别 2024-07-18 v1 人工智能 机器学习

摘要

深度学习在帮助放射科医生检测乳腺癌方面拥有巨大的潜力。然而,由于患者隐私 concerns 常导致数据获取和共享受限,无法实现最佳模型性能。此外,传统深度学习模型可能无意中泄露敏感训练信息。本工作通过探索和量化隐私保护深度学习技术的实用性来应对这些挑战,具体包括 (i) 差分隐私随机梯度下降 (DP-SGD) 和 (ii) 由我们提出的恶性肿瘤条件生成对抗网络生成的完全合成训练数据。我们通过使用 transformer 模型对乳腺钙化灶进行下游恶性分类来评估这些方法。我们的实验结果表明,合成数据增强可以改善差分隐私模型训练中的隐私-实用性权衡。此外,模型在合成数据上进行预训练可实现卓越的性能,这种性能可以通过 DP-SGD 微调进一步提升,且在所有隐私保证下均有效。凭借这次对乳腺成像中隐私保护深度学习的首次深入探索,我们解决了当前和 emerging 临床隐私要求,为采用私有高实用性深度诊断模型铺平了道路。我们的可重复代码已公开于 https://github.com/RichardObi/mammo_dp。

关键词

引用

@article{arxiv.2407.12669,
  title  = {Enhancing the Utility of Privacy-Preserving Cancer Classification using Synthetic Data},
  author = {Richard Osuala and Daniel M. Lang and Anneliese Riess and Georgios Kaissis and Zuzanna Szafranowska and Grzegorz Skorupko and Oliver Diaz and Julia A. Schnabel and Karim Lekadir},
  journal= {arXiv preprint arXiv:2407.12669},
  year   = {2024}
}

备注

Early Accept at MICCAI 2024 Deep-Breath Workshop