中文

模态补偿网络:用于动作识别的跨模态自适应

计算机视觉与模式识别 2020-02-03 v1

摘要

随着RGB-D相机的普及,多模态视频数据在人类动作识别中变得更为可得。该任务的一个主要挑战在于如何有效利用它们的互补信息。在本工作中,我们提出一种模态补偿网络(MCN)来探索不同模态之间的关系,并增强用于人类动作识别的表征。我们将RGB/光流视频视为源模态,骨架视为辅助模态。我们的目标是在辅助模态的帮助下,从源模态中提取更具判别力的特征。我们的模型构建在深度卷积神经网络(CNN)和长短期记忆(LSTM)网络之上,通过模态自适应块桥接源模态与辅助模态的数据,以实现自适应表征学习,即网络学会在测试时甚至训练时补偿骨架的缺失。我们根据训练时源数据与辅助数据的对齐方式,探索了多种自适应方案,从不同层面缩小源模态与辅助模态分布之间的距离。此外,骨架仅在训练阶段需要。我们的模型能够在测试时利用源数据提升识别性能。实验结果表明,MCN在四个广泛使用的动作识别基准上优于最先进的方法。

关键词

引用

@article{arxiv.2001.11657,
  title  = {Modality Compensation Network: Cross-Modal Adaptation for Action Recognition},
  author = {Sijie Song and Jiaying Liu and Yanghao Li and Zongming Guo},
  journal= {arXiv preprint arXiv:2001.11657},
  year   = {2020}
}

备注

Accepted by IEEE Trans. on Image Processing, 2020. Project page: http://39.96.165.147/Projects/MCN_tip2020_ssj/MCN_tip_2020_ssj.html