中文

面向视频目标检测的双语义融合网络

计算机视觉与模式识别 2020-09-17 v1

摘要

由于复杂环境下所捕获视频序列质量退化,视频目标检测是一项艰巨任务。当前该领域由一系列基于特征增强的方法主导,这些方法从多帧中提炼有益的语义信息,并通过融合所提炼的信息生成增强特征。然而,蒸馏与融合操作通常在帧级或实例级借助额外信息(如光流和特征记忆)的外部引导来执行。本文中,我们提出一种双语义融合网络(简称DSFNet),在统一的融合框架中充分挖掘帧级与实例级语义,且无需外部引导。此外,我们将几何相似性度量引入融合过程,以缓解由噪声引起的信息失真影响。因此,所提DSFNet可通过多粒度融合生成更鲁棒的特征,并避免受外部引导不稳定性的影响。为评估所提DSFNet,我们在ImageNet VID数据集上进行了大量实验。值得注意的是,据我们所知,所提双语义融合网络在使用ResNet-101时取得了当前最优视频目标检测器中的最佳性能84.1% mAP,在使用ResNeXt-101且不加任何后处理步骤时取得了85.4% mAP。

关键词

引用

@article{arxiv.2009.07498,
  title  = {Dual Semantic Fusion Network for Video Object Detection},
  author = {Lijian Lin and Haosheng Chen and Honglun Zhang and Jun Liang and Yu Li and Ying Shan and Hanzi Wang},
  journal= {arXiv preprint arXiv:2009.07498},
  year   = {2020}
}

备注

9 pages,6 figures