中文

RELI11D:一个综合的多模态人体运动数据集与方法

计算机视觉与模式识别 2024-03-29 v1

摘要

全面捕捉人体运动既需要准确捕捉复杂姿态,又需要精确地将人体定位在场景中。大多数人体姿态估计(HPE)数据集和方法主要依赖RGB、LiDAR或IMU数据。然而,仅使用这些模态或其组合可能不足以应对HPE,特别是对于复杂和快速的运动。为了全面理解人体运动,我们提出了RELI11D,一个包含LiDAR、IMU系统、RGB相机和Event相机的高质量多模态人体运动数据集。它记录了10名演员在7个场景中进行5项运动的动作,包含3.32小时的同步LiDAR点云、IMU测量数据、RGB视频和Event流。通过大量实验,我们证明RELI11D提出了巨大的挑战和机遇,因为它包含许多需要精确定位的快速和复杂运动。为了解决整合不同模态的挑战,我们提出了LEIR,一个多模态基线,通过我们的交叉注意力融合策略有效利用LiDAR点云、Event流和RGB。我们表明,LEIR在快速运动和日常运动中均展现出有希望的结果,并且利用多种模态的特征确实可以提高HPE性能。数据集和源代码都将向研究社区公开发布,以促进合作并推动该领域的进一步探索。

关键词

引用

@article{arxiv.2403.19501,
  title  = {RELI11D: A Comprehensive Multimodal Human Motion Dataset and Method},
  author = {Ming Yan and Yan Zhang and Shuqiang Cai and Shuqi Fan and Xincheng Lin and Yudi Dai and Siqi Shen and Chenglu Wen and Lan Xu and Yuexin Ma and Cheng Wang},
  journal= {arXiv preprint arXiv:2403.19501},
  year   = {2024}
}

备注

CVPR2024, Project website: http://www.lidarhumanmotion.net/reli11d/