基于冗余削减注意力的细粒度视频分类
计算机视觉与模式识别
2018-10-29 v1
摘要
对于细粒度分类任务,视频可比静态图像提供更好的信息来源,因为视频有更高几率包含判别性模式。然而,视频序列也可能包含大量冗余且与任务无关的帧。如何定位关键的兴趣信息是一项具有挑战性的任务。本文中,我们提出一种称为冗余削减注意力(RRA)的新网络结构,其通过抑制冗余特征通道来学习关注多个判别性模式。具体而言,它首先利用时空软注意力对所有选定帧特征图中特征向量进行加权求和以概括视频,然后通过学习的非线性变换根据该概括预测应抑制或增强哪些通道。抑制通过对特征图进行调制并剔除弱激活来实现。更新后的特征图用于下一次迭代。最后,基于多个概括对视频进行分类。所提方法在多个视频分类数据集上取得了优异性能。此外,我们收集了两个大规模视频数据集 YouTube-Birds 和 YouTube-Cars,用于细粒度视频分类的后续研究。数据集可从 http://www.cs.umd.edu/~chenzhu/fgvc 获取。
引用
@article{arxiv.1810.11189,
title = {Fine-grained Video Categorization with Redundancy Reduction Attention},
author = {Chen Zhu and Xiao Tan and Feng Zhou and Xiao Liu and Kaiyu Yue and Errui Ding and Yi Ma},
journal= {arXiv preprint arXiv:1810.11189},
year = {2018}
}
备注
Correcting a typo in ECCV version