中文

从局部到整体:面向可控人体图像生成的统一参考框架

计算机视觉与模式识别 2024-04-24 v1

摘要

可控人体图像生成的最新进展已实现了利用结构信号(如姿态、深度)或面部外观进行零样本生成。然而,以人体外观多个部位为条件生成人体图像仍具挑战。为解决此问题,我们引入了 Parts2Whole,这是一种新颖的框架,旨在从多张参考图像(包括姿态图像和人体外观的多个方面)生成定制化肖像。为此,我们首先开发了一个语义感知的外观编码器,以保留不同人体部位的细节;该编码器根据每张图像的文本标签将其处理为一系列多尺度特征图,而非单一图像 token,从而保留了图像维度。其次,我们的框架通过共享自注意力机制支持多图像条件生成,该机制在扩散过程中跨参考特征和目标特征进行操作。我们通过引入来自参考人体图像的掩码信息来增强普通注意力机制,从而实现对任意部位的精确选择。大量实验证明了我们的方法优于现有替代方案,为多部位可控的人体图像定制提供了先进的能力。请访问我们的项目页面 https://huanngzh.github.io/Parts2Whole/。

关键词

引用

@article{arxiv.2404.15267,
  title  = {From Parts to Whole: A Unified Reference Framework for Controllable Human Image Generation},
  author = {Zehuan Huang and Hongxing Fan and Lipeng Wang and Lu Sheng},
  journal= {arXiv preprint arXiv:2404.15267},
  year   = {2024}
}