F3Net:用于显著目标检测的融合、反馈与聚焦网络
计算机视觉与模式识别
2019-11-27 v1
摘要
现有大多数显著目标检测模型通过聚合从卷积神经网络提取的多层特征取得了很大进展。然而,由于不同卷积层具有不同感受野,这些层生成的特征之间存在巨大差异。常见的特征融合策略(相加或拼接)忽略了这些差异,可能导致次优解。本文中,我们提出 F3Net 来解决上述问题,其主要由交叉特征模块(CFM)和级联反馈解码器(CFD)构成,并通过最小化一种新的像素位置感知损失(PPA)进行训练。具体而言,CFM 旨在选择性地聚合多层特征。与相加和拼接不同,CFM 在融合前从输入特征中自适应地选择互补成分,从而有效避免引入过多可能破坏原始特征的冗余信息。此外,CFD 采用多阶段反馈机制,将靠近监督的特征引入前层输出以补充之并消除特征间差异。这些精炼特征在生成最终显著图之前将经历多次类似迭代。进一步,与二元交叉熵不同,所提 PPA 损失不对像素一视同仁,而是综合像素的局部结构信息以引导网络更关注局部细节。来自边界或易错部分的困难像素将被赋予更多关注以强调其重要性。F3Net 能够准确分割显著目标区域并提供清晰的局部细节。在五个基准数据集上的综合实验表明,F3Net 在六项评价指标上优于现有最优方法。
引用
@article{arxiv.1911.11445,
title = {F3Net: Fusion, Feedback and Focus for Salient Object Detection},
author = {Jun Wei and Shuhui Wang and Qingming Huang},
journal= {arXiv preprint arXiv:1911.11445},
year = {2019}
}
备注
Accepted by AAAI2020, https://github.com/weijun88/F3Net