中文

基于多流网络的模态蒸馏用于动作识别

计算机视觉与模式识别 2018-10-30 v2

摘要

多样化的输入数据模态可为若干任务提供互补线索,通常带来更鲁棒的算法和更好的性能。然而,尽管(训练)数据集可以被精确地设计为包含多种传感输入,在实际部署模型的(测试)场景中往往并非所有模态都可用。这引发了如下挑战:如何在训练阶段利用多模态数据学习鲁棒表征,同时考虑测试时的限制,例如模态含噪或缺失。本文提出了一种用于多模态视频动作识别的新方法,该方法在蒸馏与特权信息的统一框架(称为广义蒸馏)内开发。特别地,我们考虑从深度与 RGB 视频中学习表征,而在测试时仅依赖 RGB 数据。我们提出了一种训练幻觉网络的新方法,该网络通过学习时空表征的乘法连接来蒸馏深度特征,并利用软标签与硬标签以及特征图之间的距离。我们在可用于该任务的最大多模态数据集 NTU RGB+D 上报告了视频动作分类的 SOTA 结果。代码见 https://github.com/ncgarcia/modality-distillation 。

关键词

引用

@article{arxiv.1806.07110,
  title  = {Modality Distillation with Multiple Stream Networks for Action Recognition},
  author = {Nuno Garcia and Pietro Morerio and Vittorio Murino},
  journal= {arXiv preprint arXiv:1806.07110},
  year   = {2018}
}

备注

Accepted at ECCV 2018; Supp. material at p.16; code available