中文

BABEL:带有英文标签的人体、动作与行为数据集

计算机视觉与模式识别 2021-06-25 v2 图形学 机器学习

摘要

理解人体运动的语义——即运动的什么、如何以及为何——是一个重要问题,需要带有语义标签的人体动作数据集。现有数据集采用两种方法之一。大规模视频数据集包含许多动作标签,但不包含真实的三维人体运动。相反,动作捕捉(mocap)数据集具有精确的身体运动,但仅限于少量动作。为此,我们提出 BABEL,一个带有语言标签的大型数据集,这些标签描述了 mocap 序列中正在执行的动作。BABEL 由来自 AMASS 约 43 小时 mocap 序列的动作标签组成。动作标签具有两个抽象层次——序列标签描述序列中的整体动作,帧标签描述序列每一帧中的所有动作。每个帧标签都与 mocap 序列中相应动作的持续时间精确对齐,且多个动作可以重叠。BABEL 中有超过 28k 个序列标签和 63k 个帧标签,属于超过 250 个独特动作类别。BABEL 中的标签可用于动作识别、时序动作定位、运动合成等任务。为展示 BABEL 作为基准的价值,我们评估了模型在三维动作识别上的性能。我们证明 BABEL 提出了适用于真实场景的有趣学习挑战,并可作为三维动作识别进展的有用基准。该数据集、基线方法和评估代码已发布,并支持学术研究用途,网址为 https://babel.is.tue.mpg.de/。

关键词

引用

@article{arxiv.2106.09696,
  title  = {BABEL: Bodies, Action and Behavior with English Labels},
  author = {Abhinanda R. Punnakkal and Arjun Chandrasekaran and Nikos Athanasiou and Alejandra Quiros-Ramirez and Michael J. Black},
  journal= {arXiv preprint arXiv:2106.09696},
  year   = {2021}
}

备注

11 pages, 4 figures, Accepted in CVPR'21