中文

时序图像序列与对象运动的联合表示用于视频对象检测

计算机视觉与模式识别 2020-11-23 v1

摘要

本文提出一种称为时序特征聚合与运动感知视频对象检测(TM-VoD)的新视频对象检测器(VoD)方法,其产生时序图像序列与对象运动的联合表示。所提 TM-VoD 聚合由卷积神经网络提取的视觉特征图,应用时序注意力门控与空间特征对齐。该时序特征聚合以分层方式分两阶段进行。第一阶段,视觉特征图通过门控注意力模型在像素级融合。第二阶段,该方法在对齐对象特征(使用时序框偏移校准)后聚合特征,并按余弦相似度度量加权。所提 TM-VoD 还分两步求得对象运动表示:首先基于相邻视觉特征图间增量变化计算像素级运动特征;然后由 RoI 对齐的像素级运动特征与框坐标的序列变化获得框级运动特征。最终所有特征拼接产生用于 VoD 的对象联合表示。在 ImageNet VID 数据集上的实验表明,该方法优于现有 VoD 方法,并取得与最先进 VoD 相当的性能。

关键词

引用

@article{arxiv.2011.10278,
  title  = {Joint Representation of Temporal Image Sequences and Object Motion for Video Object Detection},
  author = {Junho Koh and Jaekyum Kim and Younji Shin and Byeongwon Lee and Seungji Yang and Jun Won Choi},
  journal= {arXiv preprint arXiv:2011.10278},
  year   = {2020}
}