ViDSOD-100:用于RGB-D视频显著目标检测的新数据集与基线模型
计算机视觉与模式识别
2024-09-20 v2
摘要
随着深度传感器的快速发展,可以获取越来越多的RGB-D视频。识别RGB-D视频中的前景是一项基础且重要的任务。然而,现有的显著目标检测(SOD)工作仅关注静态RGB-D图像或RGB视频,忽略了RGB-D与视频信息的协同作用。在本文中,我们首先收集了一个新的带标注的RGB-D视频SOD(ViDSOD-100)数据集,该数据集包含100个视频,共9,362帧,采集自不同的自然场景。每个视频中的所有帧都被手动标注为高质量的显著图。此外,我们提出了一种新的基线模型,称为注意力三重融合网络(ATF-Net),用于RGB-D视频显著目标检测。我们的方法通过设计三个模态特定分支和一个多模态集成分支,聚合来自输入RGB图像的外观信息、来自估计运动图的时空信息以及来自深度图的几何信息。模态特定分支提取不同输入的表示,而多模态集成分支通过引入编码器特征聚合(MEA)模块和解码器特征聚合(MDA)模块来组合多级模态特定特征。在我们新引入的ViDSOD-100数据集和已建立的DAVSOD数据集上进行的实验结果表明,所提出的ATF-Net具有优越的性能。这种性能提升在定量和定性上均得到体现,超越了当前在RGB-D显著检测、视频显著检测和视频目标分割等多个领域的最先进技术。我们的数据和代码可在github.com/jhl-Det/RGBD_Video_SOD获取。
引用
@article{arxiv.2406.12536,
title = {ViDSOD-100: A New Dataset and a Baseline Model for RGB-D Video Salient Object Detection},
author = {Junhao Lin and Lei Zhu and Jiaxing Shen and Huazhu Fu and Qing Zhang and Liansheng Wang},
journal= {arXiv preprint arXiv:2406.12536},
year = {2024}
}