中文

用于动态视觉识别的扫视与聚焦网络

计算机视觉与模式识别 2022-08-05 v2 人工智能 机器学习

摘要

空间冗余广泛存在于视觉识别任务中,即图像或视频帧中的判别性特征通常仅对应于像素的一个子集,而其余区域与当前任务无关。因此,以相等计算量处理所有像素的静态模型在时间和空间消耗上造成了相当大的冗余。本文将从图像识别问题表述为一个由粗到细的序列特征学习过程,模拟人类视觉系统。具体而言,所提出的扫视与聚焦网络(Glance and Focus Network, GFNet)首先以低分辨率尺度提取输入图像的快速全局表示,然后策略性地关注一系列显著(小)区域以学习更精细的特征。该序列过程自然地在测试时促进了自适应推理,因为一旦模型对其预测足够自信便可终止,从而避免进一步的冗余计算。值得注意的是,我们模型中定位判别区域的问题被表述为一个强化学习任务,因此除分类标签外不需要额外的手动标注。GFNet具有通用性和灵活性,兼容任何现成的骨干模型(如MobileNets、EfficientNets和TSM),可方便地部署为特征提取器。在多种图像分类和视频识别任务以及各类骨干模型上的大量实验证明了我们方法的显著效率。例如,它在iPhone XS Max上将高效MobileNet-V3的平均延迟降低了1.3倍且不损失精度。代码和预训练模型可在 https://github.com/blackfeather-wang/GFNet-Pytorch 获取。

关键词

引用

@article{arxiv.2201.03014,
  title  = {Glance and Focus Networks for Dynamic Visual Recognition},
  author = {Gao Huang and Yulin Wang and Kangchen Lv and Haojun Jiang and Wenhui Huang and Pengfei Qi and Shiji Song},
  journal= {arXiv preprint arXiv:2201.03014},
  year   = {2022}
}

备注

Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (T-PAMI). Journal version of arXiv:2010.05300 (NeurIPS 2020). The first two authors contributed equally