中文

生成模型改善分布偏移下医学分类器的公平性

计算机视觉与模式识别 2023-04-20 v1

摘要

机器学习中一个普遍存在的挑战是域泛化问题。这可能加剧对模型开发所用数据集中代表性不足群体或标签的偏见。模型偏见可能导致意外的危害,尤其在医疗保健等安全关键应用中。此外,由于成本高昂或缺乏现成的领域专业知识,获取标注数据的困难使该挑战更加复杂。在我们的工作中,我们展示了利用生成模型以标签高效的方式从数据中自动学习真实增强的可能性。具体而言,我们利用更丰富的无标注数据来捕捉一种成像模态下不同病症与子群的基础数据分布。通过对生成模型施加适当条件,我们可按特定需求引导合成样本的分布。我们证明,这些学习到的增强能通过使模型在分布内与分布外更具鲁棒性和统计公平性,从而超越启发式增强。为评估我们方法的通用性,我们研究了3个难度各异的医学影像场景:(i)来自公开泛化基准的组学病理图像,(ii)来自公开临床数据集的胸部X光片,以及(iii)具有复杂偏移与成像条件的皮肤病学图像。以合成样本补充真实训练样本,改善了模型在所有三个医学任务中的鲁棒性,并通过提升代表性不足群体内诊断准确率来增进公平性。该方法在跨模态OOD上带来显著改善:组学病理中预测准确率提升7.7%,胸部放射学中提升5.2%且公平性差距降低44.6%,皮肤病学中高风险敏感度惊人地提升63.5%且公平性差距缩小7.5倍。

关键词

引用

@article{arxiv.2304.09218,
  title  = {Generative models improve fairness of medical classifiers under distribution shifts},
  author = {Ira Ktena and Olivia Wiles and Isabela Albuquerque and Sylvestre-Alvise Rebuffi and Ryutaro Tanno and Abhijit Guha Roy and Shekoofeh Azizi and Danielle Belgrave and Pushmeet Kohli and Alan Karthikesalingam and Taylan Cemgil and Sven Gowal},
  journal= {arXiv preprint arXiv:2304.09218},
  year   = {2023}
}