SODAWideNet——无需ImageNet预训练的注意力增强宽编解码器显著目标检测网络
计算机视觉与模式识别
2023-11-10 v2
摘要
开发新的显著目标检测(SOD)模型需要选择ImageNet预训练骨干网络并设计新颖的特征精炼模块以利用骨干特征。然而,在预训练骨干上添加新组件需要在ImageNet数据集上重新训练整个网络,耗时巨大。因此,我们探索直接从零开始训练、在SOD上训练且无需ImageNet预训练的神经网络。此种构想为设计任务特定组件提供了充分自主性。为此,我们提出SODAWideNet,一种编解码器风格的显著目标检测网络。我们偏离常见的窄而深卷积模型范式,转向宽而浅架构,从而得到一个参数高效的深度神经网络。为实现更浅的网络,我们从网络起始处利用空洞卷积与自注意力组合扩大感受野。因此,我们提出多感受野特征聚合模块(MRFFAM),利用空洞卷积在高分辨率下从更远区域高效获取判别性特征。接下来,我们提出多尺度注意力(MSA),其构建特征金字塔并跨多分辨率高效计算注意力以从更大特征图中提取全局特征。最后,我们提出两个变体SODAWideNet-S(3.03M)和SODAWideNet(9.03M),在五个数据集上取得了与最先进模型相当的性能。
引用
@article{arxiv.2311.04828,
title = {SODAWideNet -- Salient Object Detection with an Attention augmented Wide Encoder Decoder network without ImageNet pre-training},
author = {Rohit Venkata Sai Dulam and Chandra Kambhamettu},
journal= {arXiv preprint arXiv:2311.04828},
year = {2023}
}
备注
Accepted at ISVC'23