TF-Blender:用于视频目标检测的时间特征混合器
计算机视觉与模式识别
2021-08-13 v1
摘要
视频目标检测是一项具有挑战性的任务,因为孤立的视频帧可能遭遇外观退化,给检测带来极大混淆。一种流行的解决方案是利用时间信息,通过聚合相邻帧的特征来增强逐帧表示。尽管在检测上取得了改进,现有方法侧重于选择更高层视频帧进行聚合,而非建模低层时间关系以增加特征表示。为克服此局限,我们提出一种名为TF-Blender的新方案,包含三个模块:1) 时间关系建模当前帧与其邻帧间的关系以保留空间信息;2) 特征调整丰富每个邻帧特征图的表示;3) 特征混合器结合前两个模块的输出并为后续检测任务生成更强的特征。因其简洁性,TF-Blender可轻松插入任意检测网络以改善检测表现。在ImageNet VID和YouTube-VIS基准上的大量评测表明了在近期最先进方法上使用TF-Blender的性能保证。
引用
@article{arxiv.2108.05821,
title = {TF-Blender: Temporal Feature Blender for Video Object Detection},
author = {Yiming Cui and Liqi Yan and Zhiwen Cao and Dongfang Liu},
journal= {arXiv preprint arXiv:2108.05821},
year = {2021}
}