中文

面向目标忠实扩散生成的自适应辅助提示混合

计算机视觉与模式识别 2026-03-20 v1

摘要

基于扩散的文本到图像(T2I)模型在生成逼真且语义丰富的图像方面取得了显著进展。然而,当目标概念位于训练分布的低密度区域时,这些模型常常产生语义不一致或结构不一致的结果。这种限制源于文本图像数据集的长尾特性,其中稀有概念或编辑指令常被低估。为解决此问题,我们引入自适应辅助提示混合(AAPB)——一个统一框架,用于稳定低密度区域的扩散过程。AAPB 利用辅助锚提示在稀有概念生成中提供语义支持,在图像编辑中提供结构支持,确保对目标提示的忠实引导。不同于先前的启发式提示交替方法,AAPB 推导出一种闭式自适应系数,以在每个扩散步骤中最佳平衡辅助锚和目标提示的影响。基于 Tweedie 同一性,我们的公式提供了一个原则且无训练的框架,用于自适应提示混合,确保稳定且忠实于目标的生成。我们通过受控实验展示了自适应插值相对于固定插值的有效性,并在 RareBench 和 FlowEdit 数据集上实现了在语义准确性和结构保真度方面优于先前无训练基线方法的持久改进。

关键词

引用

@article{arxiv.2603.19158,
  title  = {Adaptive Auxiliary Prompt Blending for Target-Faithful Diffusion Generation},
  author = {Kwanyoung Lee and SeungJu Cha and Yebin Ahn and Hyunwoo Oh and Sungho Koh and Dong-Jin Kim},
  journal= {arXiv preprint arXiv:2603.19158},
  year   = {2026}
}

备注

Accepted in CVPR 2026 (main track). 10 pages, 6 figures; supplementary material included (14 pages, 11 figures)