PANDA:一个十亿像素级以人为中心的视频数据集
计算机视觉与模式识别
2020-03-11 v1
摘要
我们提出 PANDA,首个十亿像素级以人为中心的视频数据集(gigaPixel-level humAN-centric viDeo dAtaset),用于大规模、长时序和多目标的视觉分析。PANDA 中的视频由十亿像素相机拍摄,覆盖具有宽视场(约 1 平方千米面积)和高分辨率细节(约十亿像素/帧)的真实场景。场景中可能包含 4000 个人头计数,且尺度变化超过 100 倍。PANDA 提供了丰富且分层的真实标注,包括 15,974.6k 个边界框、111.8k 个细粒度属性标签、12.7k 条轨迹、2.2k 个群体和 2.9k 次交互。我们对人体检测与跟踪任务进行了基准测试。由于行人姿态、尺度、遮挡和轨迹的巨大差异,现有方法在准确率和效率上均面临挑战。鉴于 PANDA 同时具备宽视场和高分辨率的独特性,我们引入了一项新的交互感知群体检测任务。我们设计了一个“由全局到局部放大”的框架,同时编码全局轨迹与局部交互,取得了有前景的结果。我们相信 PANDA 将通过理解大规模真实场景中的人类行为与交互,为人工智能和行为科学(praxeology)领域做出贡献。PANDA 网站:http://www.panda-dataset.com。
引用
@article{arxiv.2003.04852,
title = {PANDA: A Gigapixel-level Human-centric Video Dataset},
author = {Xueyang Wang and Xiya Zhang and Yinheng Zhu and Yuchen Guo and Xiaoyun Yuan and Liuyu Xiang and Zerun Wang and Guiguang Ding and David J Brady and Qionghai Dai and Lu Fang},
journal= {arXiv preprint arXiv:2003.04852},
year = {2020}
}
备注
Accepted by IEEE International Conference on Computer Vision and Pattern Recognition (CVPR) 2020