通过联合表示语言、姿态和合成IMU增强基于惯性手势的行为识别
计算机视觉与模式识别
2024-07-30 v2 人工智能
摘要
由于HAR领域标注传感器数据稀缺, prior research 转向视频数据合成惯性测量单元(IMU)数据,充分利用其丰富的活动注释。然而,视频生成IMU数据在实际应用中具有挑战,由于合成IMU数据质量较差且在细粒度动作识别中作用有限。本文提出MultiNet,我们的新型多模态、多任务和对比学习框架以解决数据有限的问题。我们的预训练程序使用来自线上仓库的视频数据,旨在学习文本、姿态和IMU的联合表示。通过采用视频数据和对比学习,我们的方法旨在增强可穿戴HAR性能,尤其在识别细微活动方面。我们的实验结果验证了该方法在提升HAR性能方面的有效性。我们展示,使用我们的方法从视频生成的合成IMU数据训练的模型在识别细粒度活动方面优于现有方法。
引用
@article{arxiv.2406.01316,
title = {Enhancing Inertial Hand based HAR through Joint Representation of Language, Pose and Synthetic IMUs},
author = {Vitor Fortes Rey and Lala Shakti Swarup Ray and Xia Qingxin and Kaishun Wu and Paul Lukowicz},
journal= {arXiv preprint arXiv:2406.01316},
year = {2024}
}
备注
ISWC 2024