中文

基于扩散桥梁的视觉提示文本化用于图像编辑

计算机视觉与模式识别 2025-01-28 v2 机器学习

摘要

视觉提示(即前后编辑图像的配对)能够传递不可用文字描述的图像变换,在图像编辑领域具有广泛应用前景。然而,现有视觉提示方法依赖于预训练的文本导向图像到图像生成模型,需包含文本、原始图像和编辑后图像的三元组进行 retraining,这限制了方法的可扩展性和泛化性。本文提出一种基于任意单个文本到图像模型的框架,无需显式图像到图像模型,显著提升通用性和可扩展性。具体而言,借助概率流常微分方程,我们构建扩散桥梁,在文本引导下在前后图像分布之间进行传递。通过优化文本,框架自适应地将视觉提示所传递的编辑变换文本化为文本嵌入,无需额外模型。同时,我们引入文本优化中的差分注意力控制,使文本嵌入仅捕获细腻的变换,解耦合前后图像的不变性,并可推广至编辑多种图像。实验在真实图像上验证,仅凭一个图像对即可实现在泛化性、上下文连贯性和高保真度细腻编辑方面的竞争性能。

关键词

引用

@article{arxiv.2501.03495,
  title  = {Textualize Visual Prompt for Image Editing via Diffusion Bridge},
  author = {Pengcheng Xu and Qingnan Fan and Fei Kou and Shuai Qin and Hong Gu and Ruoyu Zhao and Charles Ling and Boyu Wang},
  journal= {arXiv preprint arXiv:2501.03495},
  year   = {2025}
}

备注

AAAI 2025