MaskFi:用于多模态人类活动识别的 WiFi 与视觉表征无监督学习
计算机视觉与模式识别
2024-03-01 v1
摘要
人类活动识别 (HAR) 在医疗保健、安全监控和元宇宙游戏等各种领域发挥着越来越重要的作用。尽管已开发出众多基于计算机视觉的 HAR 方法并显示出卓越性能,但它们在恶劣视觉条件下(特别是低光照)仍受限于鲁棒性较差,这促使基于 WiFi 的 HAR 成为一种良好的互补模态。现有的利用 WiFi 和视觉模态的解决方案依赖于大量难以收集的数据标签。本文提出了一种新颖的无监督多模态 HAR 解决方案 MaskFi,仅利用未标记的视频和 WiFi 活动数据进行模型训练。我们提出了一种新算法,即掩码 WiFi-视觉建模 (MI2M),使模型能够通过预测表征学习中的掩码部分来学习跨模态和单模态特征。得益于我们的无监督学习过程,该网络仅需少量标注数据即可进行微调,并能以更好的性能适应新环境。我们在两个内部收集的 WiFi-视觉数据集上进行了广泛实验,我们的方法在鲁棒性和准确性方面均实现了人类活动识别和人类身份识别。
引用
@article{arxiv.2402.19258,
title = {MaskFi: Unsupervised Learning of WiFi and Vision Representations for Multimodal Human Activity Recognition},
author = {Jianfei Yang and Shijie Tang and Yuecong Xu and Yunjiao Zhou and Lihua Xie},
journal= {arXiv preprint arXiv:2402.19258},
year = {2024}
}
备注
9 pages