中文

通过联合表示语言、姿态和合成IMU增强基于惯性手势的行为识别

计算机视觉与模式识别 2024-07-30 v2 人工智能

摘要

由于HAR领域标注传感器数据稀缺, prior research 转向视频数据合成惯性测量单元(IMU)数据,充分利用其丰富的活动注释。然而,视频生成IMU数据在实际应用中具有挑战,由于合成IMU数据质量较差且在细粒度动作识别中作用有限。本文提出Multi3^3Net,我们的新型多模态、多任务和对比学习框架以解决数据有限的问题。我们的预训练程序使用来自线上仓库的视频数据,旨在学习文本、姿态和IMU的联合表示。通过采用视频数据和对比学习,我们的方法旨在增强可穿戴HAR性能,尤其在识别细微活动方面。我们的实验结果验证了该方法在提升HAR性能方面的有效性。我们展示,使用我们的方法从视频生成的合成IMU数据训练的模型在识别细粒度活动方面优于现有方法。

关键词

引用

@article{arxiv.2406.01316,
  title  = {Enhancing Inertial Hand based HAR through Joint Representation of Language, Pose and Synthetic IMUs},
  author = {Vitor Fortes Rey and Lala Shakti Swarup Ray and Xia Qingxin and Kaishun Wu and Paul Lukowicz},
  journal= {arXiv preprint arXiv:2406.01316},
  year   = {2024}
}

备注

ISWC 2024