中文

IP-Prompter:基于动态视觉提示的无训练主题专属图像生成

计算机视觉与模式识别 2025-05-21 v2

摘要

我们成长过程中沉浸于故事与人物所构建的独特幻想世界,图像是我们直观体验这些领域的主要媒介。通过针对主题专属数据进行微调来实现生成模型的个性化已成为文本到图像生成中常见的方法。然而,与专注于学习特定物体的对象定制不同,主题专属生成涵盖了多样化的元素,包括人物、场景和物体。这种多样性也引入了一个关键挑战:如何自适应生成多人物、多概念和连续的主题专属图像(TSI)。此外,微调方法通常伴随着显著的计算开销、时间成本以及过拟合风险。这篇论文探讨了一个根本问题:生成模型能否直接像大语言模型使用文本作为上下文一样,利用图像作为上下文输入。为此,我们提出了 IP-Prompter,这是一种新颖的无训练 TSI 生成方法。IP-Prompter 引入视觉提示机制,将参考图像集成到生成模型中,使用户无需额外训练即可无缝指定目标主题。为进一步提升此过程,我们提出了动态视觉提示(DVP)机制,通过迭代优化视觉提示来提高生成图像的准确性和质量。我们的方法支持多样化应用,包括持久故事生成、人物设计、真实人物生成和风格导向图像生成。与最新专注于个性化的方法进行比较评估,IP-Prompter 在保持人物身份一致性、风格一致性和文本对齐方面显著优于现有方法,为主题专属图像生成提供了稳健且灵活的解决方案。

关键词

引用

@article{arxiv.2501.15641,
  title  = {IP-Prompter: Training-Free Theme-Specific Image Generation via Dynamic Visual Prompting},
  author = {Yuxin Zhang and Minyan Luo and Weiming Dong and Xiao Yang and Haibin Huang and Chongyang Ma and Oliver Deussen and Tong-Yee Lee and Changsheng Xu},
  journal= {arXiv preprint arXiv:2501.15641},
  year   = {2025}
}

备注

Accepted by ACM SIGGRAPH 2025. Project page: https://ip-prompter.github.io/