中文

通过跨模态知识蒸馏学习增强 RGB 表示用于动作检测

计算机视觉与模式识别 2021-08-10 v1

摘要

在视频理解中,大多数跨模态知识蒸馏 (KD) 方法专为分类任务设计,聚焦于裁剪后视频的判别性表示。然而,动作检测不仅需要对动作分类,还需在未裁剪视频中定位动作。因此,迁移与时间关系相关的知识对该任务至关重要,而以往的跨模态 KD 框架缺失了这一部分。为此,我们旨在利用训练时通过 KD 引入的额外模态,学习用于动作检测的增强 RGB 表示。我们提出一个包含两级蒸馏的 KD 框架。一方面,原子级蒸馏以对比方式鼓励 RGB 学生网络从教师网络学习动作的子表示。另一方面,序列级蒸馏鼓励学生网络从教师网络学习时序知识,包括迁移全局上下文关系与动作边界显著性。最终结果是一个增强 RGB 流,能在仅使用 RGB 进行推理时取得与双流网络相竞争的性能。大量实验分析表明,我们所提蒸馏框架具有通用性,并在动作检测任务中优于其他流行的跨模态蒸馏方法。

关键词

引用

@article{arxiv.2108.03619,
  title  = {Learning an Augmented RGB Representation with Cross-Modal Knowledge Distillation for Action Detection},
  author = {Rui Dai and Srijan Das and Francois Bremond},
  journal= {arXiv preprint arXiv:2108.03619},
  year   = {2021}
}