用于视频目标检测的顺序级语义聚合
计算机视觉与模式识别
2019-08-21 v2
摘要
视频目标检测(VID)近年来成为一个兴起的研究方向。VID 的一个核心问题是视频帧因快速运动而产生的表观退化。该问题对单帧而言本质上是病态的。因此,从其他帧聚合特征成为一种自然的选择。现有方法严重依赖光流或循环神经网络进行特征聚合。然而,这些方法更侧重于时间上邻近的帧。本文中,我们认为在完整序列级别聚合特征将为视频目标检测带来更具判别力且更鲁棒的特征。为实现该目标,我们设计了一个新颖的顺序级语义聚合(SELSA)模块。我们进一步展示了所提方法与经典谱聚类方法的密切联系,为理解 VID 问题提供了新视角。我们在 ImageNet VID 与 EPIC KITCHENS 数据集上测试了所提方法,并取得了新的 SOTA 结果。我们的方法不需要诸如 Seq-NMS 或 Tubelet rescoring 等复杂的后处理方法,从而保持了流程的简单与清晰。
引用
@article{arxiv.1907.06390,
title = {Sequence Level Semantics Aggregation for Video Object Detection},
author = {Haiping Wu and Yuntao Chen and Naiyan Wang and Zhaoxiang Zhang},
journal= {arXiv preprint arXiv:1907.06390},
year = {2019}
}
备注
ICCV 2019 camera ready