用于视频目标检测的记忆增强全局-局部聚合方法
计算机视觉与模式识别
2020-03-27 v1 机器学习
图像与视频处理
摘要
人类如何识别视频中的物体?由于单帧质量退化,人们仅利用一幅图像内的信息可能难以识别该帧中被遮挡的物体。我们认为人类在视频中识别物体时有两条重要线索:全局语义信息与局部定位信息。近来大量方法采用自注意力机制,利用全局语义信息或局部定位信息来增强关键帧特征。本文提出记忆增强全局-局部聚合(MEGA)网络,这是首批充分兼顾全局与局部信息的尝试之一。此外,借助新颖且精心设计的远程记忆(LRM)模块,我们所提出的 MEGA 可使关键帧获取比以往任何方法都多得多的内容。在这两类信息增强下,我们的方法在 ImageNet VID 数据集上取得了最先进的性能。代码见 \url{https://github.com/Scalsol/mega.pytorch}。
引用
@article{arxiv.2003.12063,
title = {Memory Enhanced Global-Local Aggregation for Video Object Detection},
author = {Yihong Chen and Yue Cao and Han Hu and Liwei Wang},
journal= {arXiv preprint arXiv:2003.12063},
year = {2020}
}
备注
Accepted by CVPR2020