中文

Visual Persona:用于全身人物定制的基础模型

计算机视觉与模式识别 2025-03-25 v2

摘要

我们介绍 Visual Persona,这是一种基于文本到图像的全身人物定制基础模型。该模型输入为单张野外人物图像,可生成由文本描述引导的多样化个体图像。不同于仅关注面部身份保持的先前方法,本方法捕获详细的全身外观,与文本描述相匹配的身体结构和场景变体。训练该模型需要大规模的配对人物数据,数据中每个个体拥有多张保持一致全身身份的图像,而这类数据获取极其困难。为解决此问题,我们提出了一种利用视觉语言模型评估全身外观一致性的数据 curated 流程,得到 Visual Persona-500K 数据集,包含 58 万张人物图像,覆盖 10 万个独立身份。为实现精确的外观迁移,我们引入了适配预训练文本到图像扩散模型的变换器编码器-解码器架构,该架构将输入图像增强为多个身体区域,分别编码这些区域作为局部外观特征,并独立投影到稠密身份嵌入中,以条件化扩散模型生成定制化图像。Visual Persona 在生成来自野外输入的高质量定制图像方面 consistently 优于现有方法。广泛的消融研究验证了设计选择,并展示了 Visual Persona 在各种下游任务中的多样性。

关键词

引用

@article{arxiv.2503.15406,
  title  = {Visual Persona: Foundation Model for Full-Body Human Customization},
  author = {Jisu Nam and Soowon Son and Zhan Xu and Jing Shi and Difan Liu and Feng Liu and Aashish Misraa and Seungryong Kim and Yang Zhou},
  journal= {arXiv preprint arXiv:2503.15406},
  year   = {2025}
}

备注

CVPR 2025, Project page is available at https://cvlab-kaist.github.io/Visual-Persona