以医学图像生成克服数据共享障碍:一项综合评估
图像与视频处理
2021-08-18 v3 计算机视觉与模式识别
摘要
围绕共享个人可识别信息的隐私担忧是医学研究中数据共享的主要实际障碍。然而,在许多情况下,研究者对特定个体的信息并无兴趣,而是旨在在群体层面获得见解。在此,我们利用生成对抗网络(GANs)创建完全由合成患者数据构成的衍生医学成像数据集。理想情况下,合成图像在总体上具有与源数据集相似的统计特性,但不包含敏感个人信息。我们评估了两种 GAN 模型为胸部 X 线(具有 14 种不同放射学发现)和脑部计算机断层扫描(CT,具有六类颅内出血)生成的合成数据质量。我们通过分别在合成或真实数据集上训练的预测模型性能差异来衡量合成图像质量。我们发现,合成数据性能不成比例地从减少的唯一标签组合数量中获益。我们的开源基准还表明,在每类样本数较低时,标签过拟合效应开始主导 GAN 训练。我们还进行了一项读者研究,其中受过训练的放射科医生在区分中等分辨率下的合成与真实医学图像时表现不优于随机。与我们的基准结果一致,放射科医生的分类准确率在较高空间分辨率下提升。我们的研究提供了有价值的指导方针,并概述了从中提取的见解与从真实成像数据中提取的见解相似的实际条件。我们的结果表明,在适当环境下,合成数据共享可能是共享真实患者级数据的一种有吸引力且保护隐私的替代方案。
引用
@article{arxiv.2012.03769,
title = {Overcoming Barriers to Data Sharing with Medical Image Generation: A Comprehensive Evaluation},
author = {August DuMont Schütte and Jürgen Hetzel and Sergios Gatidis and Tobias Hepp and Benedikt Dietz and Stefan Bauer and Patrick Schwab},
journal= {arXiv preprint arXiv:2012.03769},
year = {2021}
}