中文

UniPose:面向人体姿态理解、生成与编辑的统一多模态框架

计算机视觉与模式识别 2025-04-01 v2 人工智能

摘要

人体姿态在数字时代中发挥着关键作用。虽然近期工作在理解和生成人体姿态方面取得了显著进展,但它们往往仅支持单一模式的控制信号,并在孤立情况下运行,限制了其在实际场景中的应用。本文提出UniPose,一种利用大型语言模型(LLM)进行跨多种模态(包括图像、文本和3D SMPL姿态)的人体姿态理解、生成与编辑的框架。具体而言,我们应用姿态标记器将3D姿态转换为离散姿态标记,实现在统一词汇表中的无缝集成。为进一步增强细粒度姿态感知能力,我们为UniPose配备了混合视觉编码器,其中包括一种针对姿态的视觉编码器。凭借统一的学习策略,UniPose能够有效跨不同姿态相关任务传递知识,适应未知任务,并展现出扩展能力。本工作是首次构建面向姿态理解、生成和编辑的通用框架。大量实验表明,UniPose在各种姿态相关任务上表现出竞争甚至领先的性能。

关键词

引用

@article{arxiv.2411.16781,
  title  = {UniPose: A Unified Multimodal Framework for Human Pose Comprehension, Generation and Editing},
  author = {Yiheng Li and Ruibing Hou and Hong Chang and Shiguang Shan and Xilin Chen},
  journal= {arXiv preprint arXiv:2411.16781},
  year   = {2025}
}