用于人体动作识别的渐进式跨模态知识蒸馏
计算机视觉与模式识别
2022-08-18 v1 多媒体
摘要
基于可穿戴传感器的人体动作识别(HAR)近期取得显著成功。然而,基于可穿戴传感器的 HAR 准确率仍远落后于基于视觉模态(即 RGB 视频、骨架与深度)的系统。多样输入模态可提供互补线索从而提升 HAR 准确率,但如何在基于可穿戴传感器的 HAR 上利用多模态数据鲜有探索。当前可穿戴设备(如智能手表)仅能捕获有限种类的非视觉模态数据。这阻碍了多模态 HAR 关联,因其无法同时使用视觉与非视觉模态数据。另一主要挑战在于如何在计算资源有限的可穿戴设备上高效利用多模态数据。本工作中,我们提出一种新颖的渐进式骨架到传感器知识蒸馏(PSKD)模型,其仅使用智能手表的时间序列数据(即加速度计数据)来解决基于可穿戴传感器的 HAR 问题。具体而言,我们利用教师(人体骨架序列)与学生(时间序列加速度计数据)模态的数据构建多个教师模型。此外,我们提出一种有效的渐进式学习方案以消除教师与学生模型间的性能差距。我们还设计了一种称为自适应置信语义(ACS)的新型损失函数,使学生模型能自适应选择需模仿的任一教师模型或真实标签。为验证所提 PSKD 方法的有效性,我们在 Berkeley-MHAD、UTD-MHAD 与 MMAct 数据集上进行了大量实验。结果证实,与先前基于单一传感器的 HAR 方法相比,所提 PSKD 方法具有具竞争力的性能。
引用
@article{arxiv.2208.08090,
title = {Progressive Cross-modal Knowledge Distillation for Human Action Recognition},
author = {Jianyuan Ni and Anne H. H. Ngu and Yan Yan},
journal= {arXiv preprint arXiv:2208.08090},
year = {2022}
}
备注
ACM MM 2022