中文

重新思考姿态引导的文本到图像生成中的稀疏信号

计算机视觉与模式识别 2025-06-27 v1

摘要

近期的工作倾向于使用密集信号(如深度、DensePose)作为稀疏信号(如OpenPose)的替代,为姿态引导的文本到图像生成提供详细的空间指导。然而,密集表示带来了新的挑战,包括编辑困难以及与文本提示的潜在不一致。这一事实促使我们重新审视用于姿态引导的稀疏信号,因为它们具有简单且形状无关的特性,而这一点仍未被充分探索。本文提出了一种新颖的Spatial-Pose ControlNet(SP-Ctrl),为姿态引导的图像生成中的稀疏信号配备了稳健的可控性。具体而言,我们将OpenPose扩展为可学习的空间表示,使关键点嵌入具有判别性和表达能力。此外,我们引入了关键点概念学习,鼓励关键点token关注每个关键点的空间位置,从而改善姿态对齐。在以动物和人为中心的图像生成任务上的实验表明,在稀疏姿态引导下,我们的方法优于近期空间可控的T2I生成方法,甚至匹配了基于密集信号方法的性能。此外,SP-Ctrl在通过稀疏信号进行多样化和跨物种生成方面展现出了良好的能力。代码将在 https://github.com/DREAMXFAR/SP-Ctrl 提供。

关键词

引用

@article{arxiv.2506.20983,
  title  = {Rethink Sparse Signals for Pose-guided Text-to-image Generation},
  author = {Wenjie Xuan and Jing Zhang and Juhua Liu and Bo Du and Dacheng Tao},
  journal= {arXiv preprint arXiv:2506.20983},
  year   = {2025}
}

备注

accepted by ICCV 2025