FLAG3D:带语言指令的3D健身活动数据集
计算机视觉与模式识别
2023-04-20 v2
摘要
随着全球持续增长的流行度,健身活动分析已成为计算机视觉中一个新兴的研究课题。尽管近期提出了多种新任务和算法,但对涉及高质量数据、细粒度标签和多样环境的数据资源的需求日益增长。在本文中,我们提出FLAG3D,一个带语言指令的大规模3D健身活动数据集,包含60类共180K序列。FLAG3D具有以下三个方面的特点:1)从先进MoCap系统捕获的准确且密集的3D人体姿态,以处理复杂活动和大幅度运动;2)详细且专业的语言指令,描述如何执行特定活动;3)来自高科技MoCap系统、渲染软件和自然环境中高性价比智能手机的多样视频资源。大量实验与深入分析表明,FLAG3D为多种挑战(如跨域人体动作识别、动态人体网格恢复和语言引导的人体动作生成)提供了重要的研究价值。我们的数据集与源代码公开于 https://andytang15.github.io/FLAG3D。
引用
@article{arxiv.2212.04638,
title = {FLAG3D: A 3D Fitness Activity Dataset with Language Instruction},
author = {Yansong Tang and Jinpeng Liu and Aoyang Liu and Bin Yang and Wenxun Dai and Yongming Rao and Jiwen Lu and Jie Zhou and Xiu Li},
journal= {arXiv preprint arXiv:2212.04638},
year = {2023}
}
备注
Accepted to CVPR2023