中文

避开模式碰撞:改善扩散模型中的组合性

计算机视觉与模式识别 2026-03-17 v2 机器学习

摘要

我们提出改善文本到图像扩散模型中的多概念提示保真度。我们从常见的失败案例开始——例如“一只猫和一只狗”的提示,有时会生成其中一个概念缺失、模糊或与另一个概念尴尬碰撞的图像。我们假设这种情况发生在扩散模型漂移到过度强调其在训练期间强烈学习到的单一概念的混合模式时。我们引入了一种纠正性采样策略,而不是重新训练,该策略避开联合提示行为与提示中任何单一概念重叠过强的区域。目标是引导向所有概念能够以平衡的视觉存在共存的“纯粹”联合模式。我们进一步表明,现有的多概念引导方案可能在放大不平衡的不稳定权重区间内运行;我们刻画了有利区间并调整采样以保持在其中。我们的方法 CO3 是即插即用的,无需模型微调,并且补充了标准的无分类器引导。在多样化的多概念提示上的实验表明,与标准基线和先前的组合方法相比,概念覆盖率、平衡性和鲁棒性均有改善,丢弃或扭曲的概念更少。结果表明,轻量级的纠正性引导可以大大缓解现代扩散系统中脆弱的语义对齐行为。代码可在 https://github.com/debottam-dutta7/co3 获取。

关键词

引用

@article{arxiv.2509.25940,
  title  = {Steer Away From Mode Collisions: Improving Composition In Diffusion Models},
  author = {Debottam Dutta and Jianchong Chen and Rajalaxmi Rajagopalan and Yu-Lin Wei and Romit Roy Choudhury},
  journal= {arXiv preprint arXiv:2509.25940},
  year   = {2026}
}

备注

Accepted to ICLR 2026. Code: https://github.com/debottam-dutta7/co3