从姿态到活动:数据集综述与 CONVERSE 的提出
计算机视觉与模式识别
2015-11-20 v2
摘要
我们对人类动作识别领域内公开可用数据集的现状进行了综述;强调了基于姿态的方法的复兴以及人与人交互建模理解的最新进展。我们根据作为基准数据集的若干关键属性对数据集进行了分类;包括类别标签数量、提供的真值以及它们所属的应用领域。我们还考虑了每个数据集的抽象级别;将呈现动作、交互和更高层次语义活动的数据集进行分组。该综述识别了关键的基于外观和姿态的数据集,指出动作类别往往具有简单化、刻意强调或脚本化的倾向,这些类别通常很容易通过一组稳定的子动作姿态来定义。目前明显缺乏提供紧密相关动作的数据集,这些动作不是通过一系列姿态和手势隐式识别的,而是通过一组动态的交互来识别。因此,我们提出了一个新颖的数据集,通过 3D 姿态表示两个个体之间复杂的对话交互。使用两个 Kinect 深度传感器收集了描述 7 种独立对话场景的 8 种成对交互。其意图是提供在一段时间内由大量基本动作、交互和运动构建的事件;提供一组更能代表真实世界的细微动作类别,并对当前开发的识别方法提出挑战。我们相信这是首批致力于使用 3D 姿态特征进行对话交互分类的数据集之一,相关论文表明该任务确实是可行的。完整数据集已在 www.csvision.swansea.ac.uk/converse 向研究界公开发布。
引用
@article{arxiv.1511.05788,
title = {From Pose to Activity: Surveying Datasets and Introducing CONVERSE},
author = {Michael Edwards and Jingjing Deng and Xianghua Xie},
journal= {arXiv preprint arXiv:1511.05788},
year = {2015}
}
备注
Presentation of pose-based conversational human interaction dataset, review of current appearance and depth based action recognition datasets, public dataset, 38 pages