面向传感器到视觉动作识别的语义感知自适应知识蒸馏
计算机视觉与模式识别
2021-07-07 v5
摘要
现有的基于视觉的动作识别易受遮挡和外观变化的影响,而可穿戴传感器通过一维时间序列信号捕捉人体运动,可缓解这些挑战。对于同一动作,从视觉传感器和可穿戴传感器学到的知识可能相关且互补。然而,可穿戴传感器与视觉传感器捕获的动作数据在数据维度、数据分布和内在信息内容上存在显著较大的模态差异。本文提出一种新颖框架,称为语义感知自适应知识蒸馏网络(SAKDN),通过自适应地迁移和蒸馏来自多个可穿戴传感器的知识,增强视觉传感器模态(视频)中的动作识别。SAKDN使用多个可穿戴传感器作为教师模态,并使用RGB视频作为学生模态。为保留局部时间关系并便于采用视觉深度学习模型,我们通过设计基于格拉姆角场的虚拟图像生成模型,将可穿戴传感器的一维时间序列信号转换为二维图像。然后,我们构建一种新颖的相似性保持自适应多模态融合模块,以自适应融合来自不同教师网络的中间表征知识。最后,为充分挖掘并将多个训练良好的教师网络的知识迁移至学生网络,我们提出一种新颖的图引导语义判别映射损失,其利用图引导消融分析产生良好的视觉解释,突出跨模态的重要区域,并同时保留原始数据的相互关系。在Berkeley-MHAD、UTD-MHAD和MMAct数据集上的实验结果充分证明了我们所提SAKDN的有效性。
引用
@article{arxiv.2009.00210,
title = {Semantics-aware Adaptive Knowledge Distillation for Sensor-to-Vision Action Recognition},
author = {Yang Liu and Keze Wang and Guanbin Li and Liang Lin},
journal= {arXiv preprint arXiv:2009.00210},
year = {2021}
}
备注
This paper focuses on the sensor-to-vision heterogenous action recognition problem. Code is available at https://github.com/YangLiu9208/SAKDN