中文

IP-Composer:视觉概念的语义组合

计算机视觉与模式识别 2025-02-20 v1 图形学

摘要

内容创作者经常从多个视觉来源中汲取灵感,结合不同的元素来创作新的作品。现代计算方法现在旨在模拟这一基础创作过程。尽管最近的扩散模型在文本引导的组合合成方面表现出色,但文本作为媒介往往缺乏对视觉细节的精确控制。基于图像的组合方法可以捕捉更细致的特征,但现有方法通常在可捕捉的概念范围上存在局限,并且需要昂贵的训练过程或专门的数据。我们提出了 IP-Composer,这是一种新颖的无训练组合图像生成方法,它同时利用多个图像参考,并使用自然语言来描述要从每张图像中提取的概念。我们的方法建立在 IP-Adapter 的基础上,该方法根据输入图像的 CLIP 嵌入合成新图像。我们通过构建复合嵌入,将这种方法扩展到多个视觉输入,这些复合嵌入是由多个输入图像在通过文本识别的特定概念 CLIP 子空间上的投影拼接而成的。通过全面评估,我们表明我们的方法能够对更大范围的视觉概念组合实现更精确的控制。

关键词

引用

@article{arxiv.2502.13951,
  title  = {IP-Composer: Semantic Composition of Visual Concepts},
  author = {Sara Dorfman and Dana Cohen-Bar and Rinon Gal and Daniel Cohen-Or},
  journal= {arXiv preprint arXiv:2502.13951},
  year   = {2025}
}

备注

Project Page: https://ip-composer.github.io/IP-Composer/