中文

ComposeMe:用于可控人类图像生成的属性特定图像提示

计算机视觉与模式识别 2025-10-17 v2

摘要

生成对人类图像具有精细控制(如发型和服装)的高保真图像仍是个性化文本到图像合成的核心挑战。虽然先前方法强调从参考图像中保留身份信息,但缺乏模块化且无法对特定视觉属性实现解耦控制。我们提出一种新的属性特定图像提示范式,使用不同的参考图像集合指导生成人类外观各个方面(如发型、服装和身份)的生成。我们的模型将这些输入编码为属性特定的标记,并注入到预训练的文本到图像扩散模型中。这实现了对多个视觉因素的组合和解耦控制,甚至可以跨多个人类在单个图像中实现。为促进自然组合和稳健的解耦,我们构建了包含姿态和表情多样化的跨参考训练数据集,并提出一种多属性跨参考训练策略,鼓励模型从误对齐的属性输入中生成忠实输出,同时遵循身份和文本条件。广泛实验表明,我们的方法在准确遵循视觉和文本提示方面实现了最先进的性能。我们的框架为通过结合视觉提示与文本驱动的生成,为更可配置的人类图像合成铺平了道路。网页地址:https://snap-research.github.io/composeme/。

关键词

引用

@article{arxiv.2509.18092,
  title  = {ComposeMe: Attribute-Specific Image Prompts for Controllable Human Image Generation},
  author = {Guocheng Gordon Qian and Daniil Ostashev and Egor Nemchinov and Avihay Assouline and Sergey Tulyakov and Kuan-Chieh Jackson Wang and Kfir Aberman},
  journal= {arXiv preprint arXiv:2509.18092},
  year   = {2025}
}

备注

Accepted to SIGGRAPH Asia 2025, webpage: https://snap-research.github.io/composeme/