ZoomNeXt:一种用于伪装目标检测的统一协作金字塔网络
计算机视觉与模式识别
2024-07-16 v4
摘要
近期伪装目标检测(COD)试图分割视觉上融入背景的物体,这在真实场景中极为复杂和困难。除伪装物体与背景间高度内在相似性外,物体通常尺度多样、外观模糊甚至被严重遮挡。为此,我们提出一种有效的统一协作金字塔网络,模拟人类观察模糊图像和视频时的行为,即放大与缩小。具体而言,我们的方法采用缩放策略,通过多头尺度整合与丰富粒度感知单元学习有判别力的混合尺度语义,二者旨在充分挖掘候选物体与背景环境间难以察觉的线索。前者的内在多头聚合提供了更多样化的视觉模式。后者的路由机制可有效传播时空场景中的帧间差异,并能自适应停用并为静态表示输出全零结果。它们为实现静态与动态 COD 的统一架构奠定了坚实基础。此外,考虑到不可区分纹理带来的不确定性与模糊性,我们构建了一个简单而有效的正则化方法——不确定性感知损失,以鼓励在候选区域给出更高置信度的预测。我们高度任务友好的框架在图像与视频 COD 基准上持续优于现有最先进方法。我们的代码见 {https://github.com/lartpang/ZoomNeXt}。
引用
@article{arxiv.2310.20208,
title = {ZoomNeXt: A Unified Collaborative Pyramid Network for Camouflaged Object Detection},
author = {Youwei Pang and Xiaoqi Zhao and Tian-Zhu Xiang and Lihe Zhang and Huchuan Lu},
journal= {arXiv preprint arXiv:2310.20208},
year = {2024}
}
备注
Extensions to the conference version accepted by TPAMI 2024. Fixed value errors. arXiv admin note: substantial text overlap with arXiv:2203.02688