中文

CompDiff:面向公平性与零样本交叉医学图像生成的层次化组合扩散

计算机视觉与模式识别 2026-03-18 v1 人工智能

摘要

生成模型日益增多地用于增强医学成像数据集以实现更公平的人工智能。然而,一个关键假设往往未被深入探讨:即生成器本身在不同人口统计组合群体中是否能产出等质量的图像。在数据不平衡的情况下训练的模型会继承这些不平衡,导致对稀有子群体的合成质量下降,并难以处理训练数据中缺失的人口统计交叉情况。我们将此称为不平衡生成器问题。现有的 remedies 如损失重加权仅在优化层面提供有限帮助,当某些组合的训练信号稀缺或缺失时效果有限。我们提出 CompDiff,一种在表示层面解决此问题的层次化组合扩散框架。该框架包含一个专用的层次化条件网络 (HCN),对人口统计条件进行分解,生成与 CLIP 嵌入拼接作为跨注意力上下文的人口统计 token。这种结构化的分解鼓励子群间的参数共享,并支持对稀有或未出现的人口统计交叉情况的组合泛化。实验在胸部 X 光 (MIMIC-CXR) 和视网膜图像 (FairGenMed) 上表明,CompDiff 在图像质量 (FID: 64.3 vs. 75.1)、子群公平性 (ES-FID) 以及零样本交叉泛化 (held-out 交叉上最高提升 21% FID) 上均优于标准微调和 FairDiffusion。使用 CompDiff 生成的数据训练的下游分类器也表现出 improved AUROC 和降低的人口统计偏差,表明人口统计条件的架构设计是公平医学图像生成中重要且未被充分探讨的因素。代码已公开于 https://anonymous.4open.science/r/CompDiff-6FE6。

关键词

引用

@article{arxiv.2603.16551,
  title  = {CompDiff: Hierarchical Compositional Diffusion for Fair and Zero-Shot Intersectional Medical Image Generation},
  author = {Mahmoud Ibrahim and Bart Elen and Chang Sun and Gokhan Ertaylan and Michel Dumontier},
  journal= {arXiv preprint arXiv:2603.16551},
  year   = {2026}
}