中文

在推理时将图像指导注入文本条件扩散模型中

计算机视觉与模式识别 2026-05-26 v1

摘要

文本到图像扩散模型如 Stable Diffusion 能够从文本生成高质量图像,但缺乏在推理时注入视觉指导(例如草图、风格)的办法而无需重新训练。现有方法要么需要计算密集的微调,要么依赖风格迁移技术,风险与文本提示在语义上不一致。我们提出了 Visual Concept Fusion (VCF),这是一种首次在推理时同时对图像和文本提示进行双重条件的办法,且无需任何概念特定训练。VCF 通过将 CLIP 图像特征与文本嵌入空间对齐,实现对 Stable Diffusion 的视觉概念注入。VCF 由三个组件组成:(1) 一个轻量级对齐器,通过 InfoNCE 和交叉注意力重构损失将图像标记映射到文本嵌入流形上;(2) 一个融合策略,保持文本和视觉语义;(3) 一个可选的 Prompt-Noise Optimization (PNO) 模块,用于测试时精炼。我们的实验表明,VCF 成功地将来自参考图像的视觉属性包括风格、构图和颜色调色板 transferred 到目标图像中,同时保持提示一致性。定量结果显示,VCF 在参考保真度方面优于基线,尽管在文本对齐(CLIP 分数)和视觉对应性(LPIPS)之间存在权衡。

关键词

引用

@article{arxiv.2605.25191,
  title  = {Injecting Image Guidance into Text-Conditioned Diffusion Models at Inference},
  author = {Agata Żywot and Iason Skylitsis and Thijmen Nijdam and Zoe Tzifa-Kratira and Derck Prinzhorn and Konrad Szewczyk and Aritra Bhowmik},
  journal= {arXiv preprint arXiv:2605.25191},
  year   = {2026}
}