中文

Piece it Together:基于IP-Prior的部件级概念生成

计算机视觉与模式识别 2025-03-14 v1

摘要

高级生成模型在合成图像方面表现出色,但往往依赖文本为条件。在许多情况下,视觉设计师的工作超越了语言,直接从现有视觉元素中获取灵感。这些元素往往只代表潜在概念的一个片段——例如一个独特的机翼或特定的发型——作为艺术家探索如何将其整合为有机整体的灵感来源。为此,我们引入了一个生成框架,能够无缝地将用户提供的部分视觉组件整合到连贯的构图中,同时对所需的缺失部分进行采样,以生成一个合理且完整的概念。我们的方法建立在从IP-Adapter+中提取的强大且鲜有人关注的表示空间之上,在该空间上训练IP-Prior,一个轻量级的flow-matching模型,能够根据领域特定的先验条件生成连贯的构图,实现多样且具有上下文感知的生成。此外,我们提出了一种基于LoRA的微调策略,显著提高了IP-Adapter+在给定任务上的提示遵循度,解决了其在重建质量和提示遵循度之间的常见权衡。

关键词

引用

@article{arxiv.2503.10365,
  title  = {Piece it Together: Part-Based Concepting with IP-Priors},
  author = {Elad Richardson and Kfir Goldberg and Yuval Alaluf and Daniel Cohen-Or},
  journal= {arXiv preprint arXiv:2503.10365},
  year   = {2025}
}

备注

Project page available at https://eladrich.github.io/PiT/