中文

通过IMU-视频跨模态表示学习改进分布外人体活动识别

机器学习 2025-07-21 v1 计算机视觉与模式识别

摘要

基于可穿戴惯性传感器的人体活动识别在远程健康监测中扮演着关键角色。对于运动障碍患者,在其家庭环境中检测异常患者运动的能力可以实现治疗的持续优化,并在需要时帮助提醒护理人员。已有研究提出使用惯性测量单元数据的机器学习方法用于人体活动识别任务;然而,大多数方法依赖于特定应用的标签,并且缺乏对在不同环境或人群中收集的数据的泛化能力。为了解决这一局限性,我们提出了一种新的跨模态自监督预训练方法,用于从大规模未标记的IMU-视频数据中学习表示,并展示了在分布外IMU数据集(包括从帕金森病患者收集的数据集)上人体活动识别任务中泛化能力的提升。具体而言,我们的结果表明,在零样本和少样本评估下,所提出的跨模态预训练方法优于当前最先进的IMU-视频预训练方法和仅使用IMU的预训练方法。广义上讲,我们的研究提供了证据,表明在高度动态的数据模态(如IMU信号)中,跨模态预训练可能是学习可泛化数据表示的有用工具。我们的软件可在 https://github.com/scheshmi/IMU-Video-OOD-HAR 获取。

关键词

引用

@article{arxiv.2507.13482,
  title  = {Improving Out-of-distribution Human Activity Recognition via IMU-Video Cross-modal Representation Learning},
  author = {Seyyed Saeid Cheshmi and Buyao Lyu and Thomas Lisko and Rajesh Rajamani and Robert A. McGovern and Yogatheesan Varatharajah},
  journal= {arXiv preprint arXiv:2507.13482},
  year   = {2025}
}