中文

Causal-Adapter: 驯服文本到图像扩散模型以实现忠实的反事实生成

计算机视觉与模式识别 2026-05-18 v6 人工智能

摘要

我们提出了 Causal-Adapter,这是一个模块化框架,能够适配冻结的文本到图像扩散骨干网络以进行反事实图像生成。我们的方法支持对目标属性进行因果干预,并将其效果一致地传播到因果依赖项,同时保留图像的核心身份。与以往依赖提示工程而缺乏显式因果结构的方法不同,Causal-Adapter 利用结构因果建模,并采用了两种属性正则化策略:(i) 提示对齐注入,将因果属性与文本嵌入对齐以实现精确的语义控制;以及 (ii) 条件化 token 对比损失,用于解耦属性因子并减少虚假相关性。Causal-Adapter 在合成和真实世界数据集上均取得了 SOTA 性能,包括在 Pendulum 上 MAE 降低高达 91% 以实现精确的属性控制,以及在 ADNI 上 FID 降低高达 87% 以实现高保真 MRI 生成。这些结果证明了鲁棒、可泛化的反事实编辑,能够实现忠实的属性修改和强大的身份保留。代码和模型将发布于:https://leitong02.github.io/causaladapter/。

关键词

引用

@article{arxiv.2509.24798,
  title  = {Causal-Adapter: Taming Text-to-Image Diffusion for Faithful Counterfactual Generation},
  author = {Lei Tong and Zhihua Liu and Chaochao Lu and Dino Oglic and Tom Diethe and Philip Teare and Sotirios A. Tsaftaris and Chen Jin},
  journal= {arXiv preprint arXiv:2509.24798},
  year   = {2026}
}

备注

Project Page: https://leitong02.github.io/causaladapter/