中文

DCR:面向罕见组合生成的反事实吸引子引导

计算机视觉与模式识别 2026-05-08 v1

摘要

扩散模型能生成逼真的视觉内容,但往往无法生成罕见但合理的组合。当提示词包含在训练数据中有效但代表性不足的组合(如雪景海滩或夜间彩虹)时,生成过程常常会坍缩为更常见的替代方案。我们将这种失败模式识别为默认补全偏置,即去噪轨迹被隐式地吸引向高频语义配置。现有的引导机制没有显式地建模这种竞争趋势,因此难以防止此类坍缩。我们引入了默认补全排斥(DCR),这是一个无需训练的框架,能够显式地建模并抑制默认补全行为。DCR 通过放宽罕见组合因子同时保留周围语义来构建反事实吸引子,从而诱导出反映模型偏好补全的替代去噪轨迹。我们将目标轨迹与吸引子轨迹之间的差异定义为反事实漂移,并提出一种基于投影的排斥机制,以移除与该漂移方向对齐的引导分量。这能在保留其他语义分量的同时抑制不期望的频繁补全。DCR 完全在标准扩散采样过程中运行,无需重新训练或修改架构。在罕见组合提示词上的实验表明,DCR 提高了组合保真度,同时保持了视觉质量。我们的分析进一步表明,该框架揭示并抵消了内在的模型偏置,为超越显式约束强制的可控生成提供了新视角。

关键词

引用

@article{arxiv.2605.06512,
  title  = {DCR: Counterfactual Attractor Guidance for Rare Compositional Generation},
  author = {Taewon Kang and Matthias Zwicker},
  journal= {arXiv preprint arXiv:2605.06512},
  year   = {2026}
}

备注

40 pages, 33 figures