用于基于 Transformer 的伪装目标检测的特征收缩金字塔
计算机视觉与模式识别
2023-03-28 v1
摘要
视觉 Transformer 近来在伪装目标检测中展现出强大的全局上下文建模能力。然而,它们存在两个主要局限:局部建模效果较弱以及解码器中特征聚合不足,这不利于从难以区分的背景中探索细微线索的伪装目标检测。为解决这些问题,本文提出一种新颖的基于 Transformer 的特征收缩金字塔网络(FSPNet),旨在通过渐进式收缩分层解码局部性增强的邻近 Transformer 特征以用于伪装目标检测。具体而言,我们提出一种非局部令牌增强模块(NL-TEM),其采用非局部机制使邻近令牌交互并探索令牌内基于图的高阶关系,从而增强 Transformer 的局部表示。此外,我们设计了一种带有邻接交互模块(AIM)的特征收缩解码器(FSD),其通过逐层收缩金字塔渐进式聚合邻近 Transformer 特征,以尽可能累积不易察觉但有效的线索用于目标信息解码。大量定量与定性实验表明,所提模型在六个常用评价指标下,于三个具有挑战性的 COD 基准数据集上显著优于现有的 24 个竞争方法。我们的代码公开于 https://github.com/ZhouHuang23/FSPNet。
引用
@article{arxiv.2303.14816,
title = {Feature Shrinkage Pyramid for Camouflaged Object Detection with Transformers},
author = {Zhou Huang and Hang Dai and Tian-Zhu Xiang and Shuo Wang and Huai-Xin Chen and Jie Qin and Huan Xiong},
journal= {arXiv preprint arXiv:2303.14816},
year = {2023}
}
备注
CVPR 2023. Project webpage at: https://tzxiang.github.io/project/COD-FSPNet/index.html