基于子群分布对齐微调的公平医学图像扩散模型
计算机视觉与模式识别
2025-01-09 v2
摘要
文本到医学图像 (T2MedI) 采用潜在扩散模型具有巨大的潜力,以缓解医学影像数据的稀缺性并探索特定患者状态描述下病灶呈现分布。然而,像自然图像模型一样,T2MedI 模型也可能对某些子群产生偏见,忽略训练集中的少数派。在本工作中,我们首先基于预训练的 Imagen 模型构建 T2MedI 模型,保持固定的对比语言-图像预训练 (CLIP) 文本编码器,而其解码器在来自 Radiology Objects in COntext (ROCO) 数据集的医学图像上进行微调。我们对其性别偏见进行定性和定量分析。为解决此问题,我们提出在目标应用数据集上进行微调,以对齐其敏感子群分布概率。具体而言,微调的对齐损失由即插即用的敏感性-子群分类器引导,匹配生成图像与预期目标数据集之间的分类概率。此外,遵循知识蒸馏方案,我们通过 CLIP-一致性正则化项来维持图像质量。为评估,我们将目标数据集扩展为 BraST18 数据集,并在其上训练一个基于脑磁共振 (MR) 切片的人口性别分类器。通过本方法,生成的 MR 图像可显著降低与 BraTS18 数据集中性别比例的不一致性。
引用
@article{arxiv.2406.14847,
title = {Fair Text to Medical Image Diffusion Model with Subgroup Distribution Aligned Tuning},
author = {Xu Han and Fangfang Fan and Jingzhao Rong and Zhen Li and Georges El Fakhri and Qingyu Chen and Xiaofeng Liu},
journal= {arXiv preprint arXiv:2406.14847},
year = {2025}
}