JRDB-Act:用于时空动作、社交群体与活动检测的大规模数据集
计算机视觉与模式识别
2021-11-25 v2
摘要
大规模视频动作理解数据集的可用性促进了包含人物的视觉场景解释方面的进展。然而,在由移动机器人平台所捕获的传感数据流中,于包含众多人员、具有潜在高度不平衡且长尾分布动作标签的无约束真实世界环境中学会识别人类动作及其社交交互仍是一项重大挑战,这尤其因为缺乏具有代表性的大规模数据集。本文引入JRDB-Act,作为现有JRDB的扩展,其由社交移动操纵机器人捕获,反映了大学校园环境中人类日常动作的真实分布。JRDB-Act经密集标注了原子动作,包含超过2.8M个动作标签,构成一个大规模时空动作检测数据集。每个人体边界框标注有一个基于姿态的动作标签和多个(可选的)基于交互的动作标签。此外,JRDB-Act提供社交群体标注,有助于基于场景中交互将个体分组以推断其社交活动(各社交群体中的共同活动)的任务。JRDB-Act中每个标注标签均标有标注者置信度水平,这有助于可靠评估策略的发展。为展示如何有效利用此类标注,我们开发了端到端可训练流水线来学习与推断这些任务,即个体动作与社交群体检测。数据与评估代码公开于 https://jrdb.erc.monash.edu/。
引用
@article{arxiv.2106.08827,
title = {JRDB-Act: A Large-scale Dataset for Spatio-temporal Action, Social Group and Activity Detection},
author = {Mahsa Ehsanpour and Fatemeh Saleh and Silvio Savarese and Ian Reid and Hamid Rezatofighi},
journal= {arXiv preprint arXiv:2106.08827},
year = {2021}
}