面向视频目标检测的身份一致聚合
计算机视觉与模式识别
2023-08-16 v1
摘要
在视频目标检测(VID)中,常见做法是利用视频中丰富的时序上下文来增强每帧中的目标表示。现有方法不加区分地对待从不同目标获得的时序上下文,忽略了它们不同的身份。而直观上,聚合同一目标在不同帧中的局部视图可能有助于更好地理解该目标。因此,在本文中,我们旨在使模型聚焦于每个目标的身份一致时序上下文,以获得更全面的目标表示并处理目标外观的快速变化(如遮挡、运动模糊等)。然而,在现有VID模型上实现该目标面临低效率问题,因其冗余的区域提议和非并行的逐帧预测方式。为此,我们提出ClipVID,一种配备身份一致聚合(ICA)层的VID模型,专为挖掘细粒度且身份一致的时序上下文而设计。它通过集合预测策略有效减少冗余,使ICA层非常高效,并进一步使我们能够设计一种对整个视频片段进行并行片段级预测的架构。大量实验结果证明了我们方法的优越性:在ImageNet VID数据集上取得最先进(SOTA)性能(84.7% mAP),同时运行速度约比先前SOTA快7倍(39.3 fps)。
引用
@article{arxiv.2308.07737,
title = {Identity-Consistent Aggregation for Video Object Detection},
author = {Chaorui Deng and Da Chen and Qi Wu},
journal= {arXiv preprint arXiv:2308.07737},
year = {2023}
}
备注
to be appeared at ICCV2023