中文

STENet:基于超像素的RGB-D显著物体检测超级令牌增强网络

计算机视觉与模式识别 2026-03-24 v1

摘要

Transformer-based方法因其捕获长程像素依赖的卓越能力而在RGB-D显著物体检测(SOD)中受到广泛关注。然而,当前的RGB-D SOD方法面临注意力机制的二次复杂度和有限局部细节提取的挑战。为克服这些限制,本文提出一种新型超像素令牌增强网络(STENet),将超像素引入跨模态交互。STENet遵循双流编码器-解码器结构。其核心是两个量身定制的超像素驱动的跨模态交互模块,分别负责全局和局部特征增强。具体而言,我们通过扩大每个超像素的邻域范围来更新超像素生成方法,从而实现像素与超像素之间的灵活转换。基于更新后的超像素生成方法,我们首次提出超像素注意力全局增强模块,以建模全局像素到超像素的关系,而非传统的全局像素到像素的关系,这可以捕获区域级信息并降低计算复杂度。我们还提出了超像素注意力局部细化模块,该模块利用超像素内部的像素相似性筛选出一部分像素(即局部像素),然后对这些局部像素进行特征增强,从而捕获关注的局部细节。此外,我们还沿尺度融合全局和局部增强特征,以实现全面特征表示。在七个RGB-D SOD数据集上的实验结果表明,STENet在与当前最先进方法的性能上表现具有竞争力。本文的方法代码和结果已公开于 https://github.com/Mark9010/STENet。

关键词

引用

@article{arxiv.2603.21999,
  title  = {STENet: Superpixel Token Enhancing Network for RGB-D Salient Object Detection},
  author = {Jianlin Chen and Gongyang Li and Zhijiang Zhang and Liang Chang and Dan Zeng},
  journal= {arXiv preprint arXiv:2603.21999},
  year   = {2026}
}

备注

12 pages, 8 figures, accepted by IEEE TMM