面向视频显著性目标检测的引导与教学网络
计算机视觉与模式识别
2021-06-08 v3
摘要
由于挖掘时空线索的困难,现有的视频显著性目标检测(VSOD)方法在理解复杂和噪声场景方面存在局限,且常常在推断显著目标时失败。为缓解这些不足,我们提出了一种简洁而高效的架构,称为引导与教学网络(GTNet),以分别在特征和决策层级通过隐式引导与显式教学独立提取有效的空间和时间线索。具体而言,我们(a)引入时间调制器将运动特征隐式桥接到外观分支,能够协同融合跨模态特征,以及(b)利用运动引导掩码在特征聚合过程中传播显式线索。这种新颖的学习策略通过解耦复杂的时空线索并跨不同模态映射信息线索,取得了令人满意的结果。在三个具有挑战性的基准上的大量实验表明,所提方法在单块 TITAN Xp GPU 上能以约 28 fps 运行,并与 14 个前沿基线相比具有竞争力。
引用
@article{arxiv.2105.10110,
title = {Guidance and Teaching Network for Video Salient Object Detection},
author = {Yingxia Jiao and Xiao Wang and Yu-Cheng Chou and Shouyuan Yang and Ge-Peng Ji and Rong Zhu and Ge Gao},
journal= {arXiv preprint arXiv:2105.10110},
year = {2021}
}
备注
Accepted at IEEE ICIP 2021