ImPoster:基于扩散模型的文本与频率引导实现主体驱动动作个性化
计算机视觉与模式识别
2025-02-13 v1
摘要
我们提出了 ImPoster,一种用于生成目标图像的新型算法,即从'来源'主体执行'驱动'动作的图像。我们的算法输入为一对源图像(包含我们希望编辑的主体)和一张驱动图像(包含任意类别主体执行驱动动作的图像),以及两幅图像的文本描述。该方法完全无监督,无需额外的关键点或姿态等注释。我们的做法基于预训练的文本到图像潜在扩散模型,通过微调扩散模型少量迭代来学习源图像和驱动图像的特征。在推理阶段,ImPoster 执行分步文本提示,即首先沿着驱动图像图像流形的方向进行去噪,然后沿着目标图像文本描述对应的图像流形方向进行去噪。我们提出了一种新的扩散引导公式——图像频率引导,以在去噪的每个步骤中引导生成过程朝着源主体和驱动动作的图像流形方向前进。我们的频率引导公式源于图像的频域性质。我们在多样化的源-驱动图像对上进行了广泛评估,以显示相对于基线方法的改进。据我们所知,ImPoster 是首个实现主体驱动和动作驱动图像个性化的方案。代码和数据已提供,访问链接为 https://github.com/divyakraman/ImPosterDiffusion2024。
引用
@article{arxiv.2409.15650,
title = {ImPoster: Text and Frequency Guidance for Subject Driven Action Personalization using Diffusion Models},
author = {Divya Kothandaraman and Kuldeep Kulkarni and Sumit Shekhar and Balaji Vasan Srinivasan and Dinesh Manocha},
journal= {arXiv preprint arXiv:2409.15650},
year = {2025}
}