用于学习视频表示的注意力蒸馏
计算机视觉与模式识别
2020-08-18 v2
摘要
我们致力于解决利用深度模型学习运动表示以进行视频识别这一具挑战性的问题。为此,我们利用注意力模块来学习突出视频中的区域并聚合特征用于识别。具体而言,我们提出将输出注意力图作为载体,把从运动(光流)网络学到的表示迁移到 RGB 网络。我们系统地研究了注意力模块的设计,并提出了一种新颖的注意力蒸馏方法。我们的方法在主要动作基准上进行了评估,并持续以显著幅度提升了基线 RGB 网络的性能。此外,我们证明我们的注意力图可在学习中利用运动线索来识别视频帧中动作的位置。我们相信我们的方法为在深度模型中学习运动感知表示迈出了一步。我们的项目页面位于 https://aptx4869lm.github.io/AttentionDistillation/
引用
@article{arxiv.1904.03249,
title = {Attention Distillation for Learning Video Representations},
author = {Miao Liu and Xin Chen and Yun Zhang and Yin Li and James M. Rehg},
journal= {arXiv preprint arXiv:1904.03249},
year = {2020}
}