EgoHumans:一种以自我为中心的3D多人基准数据集
计算机视觉与模式识别
2023-08-22 v2 人工智能
摘要
我们提出EgoHumans,一个新的多视角多人视频基准,以推进以自我为中心的人体3D姿态估计与跟踪的当前最优水平。现有的以自我为中心的基准要么仅捕获单一主体,要么仅限室内场景,这限制了计算机视觉算法在真实世界应用中的泛化能力。我们提出了一种新颖的3D捕获设置,以构建全面的野外以自我为中心多人基准,并带有支持多种任务(如人体检测、跟踪、2D/3D姿态估计与网格恢复)的标注。我们利用配备消费级可穿戴摄像头的眼镜作为以自我为中心的视角,使我们能够捕获如打网球、击剑、排球等动态活动。此外,我们的多视角设置在严重或完全遮挡下也能生成准确的3D真值。该数据集包含超过125k张以自我为中心的图像,涵盖多样场景,特别关注具有挑战性且未编排的多人活动与快速运动的以自我为中心视角。我们严格评估了现有的state-of-the-art方法,并突出了其在以自我为中心场景中的局限,特别是在多人跟踪方面。为应对此类局限,我们提出EgoFormer,一种具有多流transformer架构与显式3D空间推理的新方法,用于估计并跟踪人体姿态。EgoFormer在EgoHumans数据集上以13.6%的IDF1显著优于先前方法。
引用
@article{arxiv.2305.16487,
title = {EgoHumans: An Egocentric 3D Multi-Human Benchmark},
author = {Rawal Khirodkar and Aayush Bansal and Lingni Ma and Richard Newcombe and Minh Vo and Kris Kitani},
journal= {arXiv preprint arXiv:2305.16487},
year = {2023}
}
备注
Accepted to ICCV 2023 (Oral)