PoseScript:关联三维人体姿态与自然语言
计算机视觉与模式识别
2024-09-11 v3
摘要
自然语言在许多计算机视觉应用中扮演关键角色,例如图像描述、视觉问答与跨模态检索,以提供细粒度语义信息。遗憾的是,尽管人体姿态对于人体理解至关重要,当前三维人体姿态数据集缺乏详尽的语言描述。为解决此问题,我们引入了 PoseScript 数据集。该数据集将来自 AMASS 的六千余个人体三维姿态与丰富的人工标注的身体部位及其空间关系描述相配对。此外,为使数据集规模适配数据饥渴的学习算法,我们提出了一种精细的描述生成流程,从给定三维关键点生成自然语言自动合成描述。该流程利用一组针对三维关键点的简单但通用的规则提取低级姿态信息,即“posecodes”(姿态码)。这些姿态码随后通过句法规则组合为更高级的文本描述。借助自动标注,可用数据量显著扩大(达 100k),使得有效预训练深度模型以微调人体描述成为可能。为展示标注姿态的潜力,我们提出了利用 PoseScript 数据集的三个多模态学习任务。首先,我们开发了将三维姿态与文本描述映射至联合嵌入空间的流程,支持从大规模数据集中跨模态检索相关姿态。其次,我们为文本条件生成三维姿态的模型建立了基线。第三,我们提出了生成姿态描述的学习流程。这些应用展示了标注姿态在多任务中的通用性与实用性,并为该领域未来研究铺平道路。
引用
@article{arxiv.2210.11795,
title = {PoseScript: Linking 3D Human Poses and Natural Language},
author = {Ginger Delmas and Philippe Weinzaepfel and Thomas Lucas and Francesc Moreno-Noguer and Grégory Rogez},
journal= {arXiv preprint arXiv:2210.11795},
year = {2024}
}
备注
TPAMI 2024, extended version of the ECCV 2022 paper