视频中的时空 tubelet 特征聚合与对象关联
计算机视觉与模式识别
2020-11-09 v2
摘要
本文研究如何利用视频中可用的时空信息来提高目标检测精度。我们提出一种两阶段目标检测器 FANet,其基于短期时空特征聚合给出初始检测集,并通过长期对象关联来精炼这些检测。首先,我们生成一组在 连续帧中包含该对象的短 tubelet 提议。然后,我们通过 tubelet 使用时间池化算子聚合 RoI 池化深度特征,该算子以与输入帧数无关的固定尺寸输出总结信息。在此基础上,我们定义双头实现,将时空聚合信息输入用于时空对象分类,将当前帧提取的空间信息输入用于对象定位与空间分类。此外,我们还针对各分支架构进行专门设计,以根据输入数据更好地执行各自任务。最后,长期关联方法利用先前计算的短 tubelet 构建长管以克服检测错误。我们在广泛使用的 ImageNet VID 数据集上评估了我们的模型,取得了 80.9% mAP,这是单模型的新 SOTA 结果。此外,在具有挑战性的小目标检测数据集 USC-GRAD-STDdb 上,我们的方案比单帧基线高出 5.4% mAP。
引用
@article{arxiv.2004.00451,
title = {Spatio-temporal Tubelet Feature Aggregation and Object Linking in Videos},
author = {Daniel Cores and Víctor M. Brea and Manuel Mucientes},
journal= {arXiv preprint arXiv:2004.00451},
year = {2020}
}