中文

DeSPITE: 探索对比式深度骨架-点云-IMU-文本嵌入以实现高级点云人体活动理解

计算机视觉与模式识别 2025-06-27 v3

摘要

尽管LiDAR(光探测与测距)作为RGB相机的有效隐私保护替代方案,用于感知人类活动,但在多模态对比预训练用于人类活动理解(例如,人类活动识别(HAR)、检索或行人重识别(RE-ID))的背景下,它仍然在很大程度上未被充分探索。为了弥补这一差距,我们的工作探索了在联合嵌入空间中学习LiDAR点云、人体骨架姿态、IMU数据和文本之间的对应关系。更具体地说,我们提出了DeSPITE,一种深度骨架-点云-IMU-文本嵌入模型,它有效地学习了跨这四种模态的联合嵌入空间。在我们实证探索的核心,我们结合了现有的LIPD和Babel数据集,这使得我们能够同步所有四种模态的数据,从而允许我们探索学习一个新的联合嵌入空间。我们的实验展示了通过DeSPITE实现的点云序列的新型人类活动理解任务,包括骨架<->点云<->IMU匹配、检索和时间时刻检索。此外,我们通过在MSR-Action3D和HMPEAR上的实验表明,DeSPITE是一种有效的点云HAR预训练策略。

关键词

引用

@article{arxiv.2506.13897,
  title  = {DeSPITE: Exploring Contrastive Deep Skeleton-Pointcloud-IMU-Text Embeddings for Advanced Point Cloud Human Activity Understanding},
  author = {Thomas Kreutz and Max Mühlhäuser and Alejandro Sanchez Guinea},
  journal= {arXiv preprint arXiv:2506.13897},
  year   = {2025}
}

备注

Accepted to ICCV 2025