SODAWideNet++:结合注意力与卷积的显著目标检测
计算机视觉与模式识别
2024-08-30 v1
摘要
显著目标检测(SOD)传统上依赖于利用ImageNet预训练骨干网络特征的特征细化模块。然而,由于SOD与图像分类任务的本质差异,这种方法限制了整个网络端到端预训练的可能性。此外,最初为图像分类设计的骨干网络架构对于SOD这类密集预测任务而言并非最优。为解决这些问题,我们提出了一种专门为SOD设计的、新颖的编码器-解码器架构——SODAWideNet++。受视觉Transformer能够从初始层就获得全局感受野的能力启发,我们引入了注意力引导的长距离特征提取(AGLRFE)模块,该模块结合了大空洞卷积与自注意力。具体而言,我们利用注意力特征来引导多个空洞卷积提取的长距离信息,从而兼得卷积操作的归纳偏置与自注意力带来的输入依赖性。与当前的ImageNet预训练范式不同,我们使用了118K张来自COCO语义分割数据集的标注图像,通过二值化其标注来端到端地预训练所提出的模型。此外,我们在监督前景的同时也监督背景预测,以促使模型生成更准确的显著性图。与最先进的模型相比,SODAWideNet++在仅使用其35%可训练参数的情况下,在五个不同数据集上取得了具有竞争力的性能。代码和显著性图可在 https://github.com/VimsLab/SODAWideNetPlusPlus 获取。
关键词
引用
@article{arxiv.2408.16645,
title = {SODAWideNet++: Combining Attention and Convolutions for Salient Object Detection},
author = {Rohit Venkata Sai Dulam and Chandra Kambhamettu},
journal= {arXiv preprint arXiv:2408.16645},
year = {2024}
}
备注
Accepted at ICPR 2024