中文

扩散Transformer中上下文空间的即时排斥以实现丰富多样性

计算机视觉与模式识别 2026-03-31 v1 人工智能 图形学 机器学习

摘要

现代文本到图像(T2I)扩散模型已取得显著的语义对齐,但它们往往严重缺乏多样性,对任何给定提示都收敛于一组狭窄的视觉解。这种典型性偏差对需要广泛生成结果的创意应用构成了挑战。我们识别出当前多样性方法中的一个基本权衡:修改模型输入需要代价高昂的优化来纳入生成路径的反馈。相比之下,在空间上已确定的中间潜在表示上操作往往会破坏正在形成的视觉结构,导致伪影。在本工作中,我们提出在上下文空间中施加排斥,作为在扩散Transformer中实现丰富多样性的新框架。通过干预多模态注意力通道,我们在Transformer前向传播过程中施加即时排斥,在文本条件化与涌现图像结构相融合的块之间注入干预。这允许在轨迹获得结构信息之后、但在构图固定之前重新引导引导方向。我们的结果表明,上下文空间中的排斥在保持视觉保真度和语义一致性的同时,产生了显著更丰富的多样性。此外,我们的方法具有独特的效率,仅施加较小的计算开销,即使在现代Turbo和蒸馏模型中传统基于轨迹的干预通常失效时仍然有效。

关键词

引用

@article{arxiv.2603.28762,
  title  = {On-the-fly Repulsion in the Contextual Space for Rich Diversity in Diffusion Transformers},
  author = {Omer Dahary and Benaya Koren and Daniel Garibi and Daniel Cohen-Or},
  journal= {arXiv preprint arXiv:2603.28762},
  year   = {2026}
}

备注

Conditionally accepted to SIGGRAPH 2026. Project page: https://contextual-repulsion.github.io/