物体不会消失:基于单帧物体位置预测的视频目标检测
计算机视觉与模式识别
2023-08-10 v1
摘要
视频中的物体通常以连续平滑的运动为特征。我们从三个方面利用连续平滑运动。1) 通过使用物体运动作为额外的监督来源来提高精度,这是我们通过从静态关键帧预测物体位置获得的。2) 通过仅在所有帧的一小部分上执行昂贵的特征计算来提高效率。由于相邻视频帧通常是冗余的,我们仅对单个静态关键帧计算特征,并预测后续帧中的物体位置。3) 降低标注成本,我们仅标注关键帧,并使用关键帧之间的平滑伪运动。我们在四个数据集(ImageNet VID、EPIC KITCHENS-55、YouTube-BoundingBoxes 和 Waymo Open dataset)上展示了相比最先进方法的计算效率、标注效率以及改进的平均精度均值(mean average precision)。我们的源代码可在 https://github.com/L-KID/Videoobject-detection-by-location-anticipation 获取。
引用
@article{arxiv.2308.04770,
title = {Objects do not disappear: Video object detection by single-frame object location anticipation},
author = {Xin Liu and Fatemeh Karimi Nejadasl and Jan C. van Gemert and Olaf Booij and Silvia L. Pintea},
journal= {arXiv preprint arXiv:2308.04770},
year = {2023}
}
备注
Accepted by ICCV 2023