一种基于 Vision Transformer 的简单而有效的伪装物体与显著物体检测网络
计算机视觉与模式识别
2024-03-01 v1
摘要
伪装物体检测 (COD) 和显著物体检测 (SOD) 是过去几十年中被广泛研究的两个不同但密切相关的计算机视觉任务。虽然它们的共同目的是将图像分割为二值前景和背景区域,但它们的区别在于 COD 专注于隐藏在图像中的隐蔽物体,而 SOD 专注于图像中最突出的物体。先前的工作通过堆叠各种手工设计的模块和多尺度特征取得了良好的性能。然而,这些精心设计的复杂网络往往在一个任务上表现良好,而在另一个任务上则不然。在这项工作中,我们提出了一种基于 Vision Transformer (ViT) 的简单而有效的网络 (SENet),通过采用一种简单的非对称 ViT 编码器 - 解码器结构设计,我们在两个任务上都取得了具有竞争力的结果,表现出比精心制作的网络更大的通用性。此外,为了增强 Transformer 建模局部信息的能力(这对像素级二值分割任务很重要),我们提出了一个局部信息捕获模块 (LICM)。我们还提出了一种基于二元交叉熵 (BCE) 和交并比 (IoU) 损失的动态加权损失 (DW loss),引导网络根据其大小更多地关注那些更小且更难发现的目标物体。此外,我们探讨了 SOD 和 COD 联合训练的问题,并提出了解决联合训练冲突的初步方案,进一步提高了 SOD 的性能。在多个基准数据集上的大量实验证明了该方法的有效性。代码可在 https://github.com/linuxsino/SENet 获取。
引用
@article{arxiv.2402.18922,
title = {A Simple yet Effective Network based on Vision Transformer for Camouflaged Object and Salient Object Detection},
author = {Chao Hao and Zitong Yu and Xin Liu and Jun Xu and Huanjing Yue and Jingyu Yang},
journal= {arXiv preprint arXiv:2402.18922},
year = {2024}
}
备注
submitted to IEEE TIP