用于视频显著性目标检测的深度协同三模态网络
计算机视觉与模式识别
2022-07-12 v2
摘要
深度可为显著性目标检测(SOD)提供有用的地理线索,并已在近期 RGB-D SOD 方法中被证明有帮助。然而,现有视频显著性目标检测(VSOD)方法仅利用时空信息,极少挖掘深度信息用于检测。本文中,我们提出一种用于 VSOD 的深度协同三模态网络,称为 DCTNet,这是将深度信息引入以辅助 VSOD 的开创性工作。为此,我们首先从 RGB 帧生成深度,然后提出一种对三模态不平等对待的方法。具体而言,设计了一个多模态注意力模块(MAM)来建模主模态(RGB)与两个辅助模态(深度、光流)之间的多模态长程依赖。我们还引入了精炼融合模块(RFM)以抑制各模态中的噪声并动态选择有用信息用于进一步特征精炼。最后,在精炼特征后采用渐进融合策略以实现最终跨模态融合。在五个基准数据集上的实验证明了我们的深度协同模型相对于 12 种最先进(SOTA)方法的优越性,并且深度的必要性也得到了验证。
引用
@article{arxiv.2202.06060,
title = {Depth-Cooperated Trimodal Network for Video Salient Object Detection},
author = {Yukang Lu and Dingyao Min and Keren Fu and Qijun Zhao},
journal= {arXiv preprint arXiv:2202.06060},
year = {2022}
}
备注
5 pages, 3 figures, Accepted at ICIP-2022