中文

NSNet:用于高效视频识别的非显著性抑制采样器

计算机视觉与模式识别 2022-07-22 v1

摘要

人工智能系统在低计算成本场景下实现准确视频识别具有挑战性。基于自适应推理的高效视频识别方法通常预览视频并聚焦于显著部分以降低计算成本。大多数现有工作关注基于视频分类目标的复杂网络学习。它们将所有帧视为正样本,极少关注监督中正样本(显著帧)与负样本(非显著帧)之间的区分。为弥补此不足,本文提出一种新颖的非显著性抑制网络(NSNet),其有效抑制非显著帧的响应。具体而言,在帧级别,生成可区分显著与非显著帧的有效伪标签以引导帧显著性学习。在视频级别,在显著与非显著表征的双重视频级监督下学习时序注意力模块。来自两个级别的显著性度量被结合以利用多粒度互补信息。在四个知名基准上的大量实验验证,我们的 NSNet 不仅实现了最优的精度-效率权衡,而且相比最优方法展现出显著更快(2.4~4.3倍)的实际推理速度。我们的项目页面位于 https://lawrencexia2008.github.io/projects/nsnet。

关键词

引用

@article{arxiv.2207.10388,
  title  = {NSNet: Non-saliency Suppression Sampler for Efficient Video Recognition},
  author = {Boyang Xia and Wenhao Wu and Haoran Wang and Rui Su and Dongliang He and Haosen Yang and Xiaoran Fan and Wanli Ouyang},
  journal= {arXiv preprint arXiv:2207.10388},
  year   = {2022}
}

备注

Accepted by ECCV 2022