中文

ChatPose:基于大语言模型聊谈三维人体姿态

计算机视觉与模式识别 2024-04-25 v2

摘要

我们引入 ChatPose,一种采用大语言模型(LLM)从图像或文本描述中理解与推理三维人体姿态的框架。我们的工作受人类直觉性地从单张图像或简短描述理解姿态的能力所启发,该过程交织了图像解读、世界知识与身体语言理解。传统的人体姿态估计与生成方法常孤立运作,缺乏语义理解与推理能力。ChatPose 通过将 SMPL 姿态作为独特信号 token 嵌入多模态 LLM 中,解决了这些局限,从而能够从文本与视觉输入直接生成三维身体姿态。借助多模态 LLM 的强大能力,ChatPose 统一了经典的三维人体姿态与生成任务,同时提供用户交互。此外,ChatPose 赋予 LLM 应用其广博世界知识推理人体姿态的能力,引出了两个进阶任务:推测性姿态生成与姿态估计推理。这些任务涉及对人类进行推理,以从细微文本查询(可能辅以图像)生成三维姿态。我们为这些任务建立了基准,超越了传统的三维姿态生成与估计方法。我们的结果表明,ChatPose 在这些新提出的任务上优于现有多模态 LLM 与任务特定方法。此外,ChatPose 基于复杂推理理解与生成三维人体姿态的能力,为人体姿态分析开辟了新方向。

关键词

引用

@article{arxiv.2311.18836,
  title  = {ChatPose: Chatting about 3D Human Pose},
  author = {Yao Feng and Jing Lin and Sai Kumar Dwivedi and Yu Sun and Priyanka Patel and Michael J. Black},
  journal= {arXiv preprint arXiv:2311.18836},
  year   = {2024}
}

备注

Home page: https://yfeng95.github.io/ChatPose/