特征流:面向视频目标检测的网络内特征流估计
计算机视觉与模式识别
2021-11-11 v2
摘要
光流表达像素位移,被广泛用于许多计算机视觉任务以提供像素级运动信息。然而,随着卷积神经网络的显著进展,近期最先进的方法被提出直接在特征层级上解决问题。由于特征向量的位移与像素位移并不一致,一种常见做法是:将光流前馈至神经网络并在任务数据集上对该网络进行微调。通过这种方法,他们期望微调后的网络产生编码特征级运动信息的张量。在本文中,我们重新思考这一事实上的范式,并分析其在视频目标检测任务中的缺陷。为缓解这些问题,我们提出一种新颖的网络(IFF-Net),其带有用于视频目标检测的\textbf{网络内}\textbf{特征}\textbf{流}估计模块(IFF模块)。无需借助在任何额外数据集上的预训练,我们的IFF模块能够直接产生指示特征位移的\textbf{特征流}。我们的IFF模块由一个浅层模块组成,该模块与检测分支共享特征。这一紧凑设计使我们的IFF-Net能够准确检测目标,同时保持快速的推理速度。此外,我们提出一种基于\textit{自监督}的变换残差损失(TRL),进一步提升了IFF-Net的性能。我们的IFF-Net优于现有方法,并在ImageNet VID上取得了最先进的性能。
引用
@article{arxiv.2009.09660,
title = {Feature Flow: In-network Feature Flow Estimation for Video Object Detection},
author = {Ruibing Jin and Guosheng Lin and Changyun Wen and Jianliang Wang and Fayao Liu},
journal= {arXiv preprint arXiv:2009.09660},
year = {2021}
}