中文

RAG-SEG:面向伪装物体检测的无训练范式

计算机视觉与模式识别 2025-09-16 v2 人工智能

摘要

伪装物体检测(Camouflaged Object Detection, COD)是计算机视觉中的重要挑战,因其物体与背景高度相似。现有方法依赖大量训练和计算资源。虽然基础模型如 Segment Anything Model(SAM)具备强大泛化能力,但仍难以在无微调情况下处理 COD 任务,且需高质量提示才能达到佳绩。手动生成此类提示成本高昂且效率低下。为此,我们提出First RAG, Second SEG(RAG-SEG),一种无训练范式,将COD任务分解为两个阶段:检索增强生成(Retrieval-Augmented Generation, RAG)生成粗糙掩码作为提示,随后采用SAM进行细化分割。RAG-SEG通过无监督聚类构建紧凑检索数据库,实现快速高效的特征检索。在推理阶段,检索到的特征产生伪标签,指导使用SAM2生成精确掩码。该方法无需常规训练,即可保持竞争性能。在基准COD数据集上的大量实验表明,RAG-SEG的性能与或优于最先进方法。值得注意的是,所有实验均在个人笔记本电脑上完成,凸显了其计算效率和实用性。我们在附录中进一步分析了局限性、显著物体检测的扩展性及可能的改进。代码:https://github.com/Lwt-diamond/RAG-SEG。

关键词

引用

@article{arxiv.2508.15313,
  title  = {First RAG, Second SEG: A Training-Free Paradigm for Camouflaged Object Detection},
  author = {Wutao Liu and YiDan Wang and Pan Gao},
  journal= {arXiv preprint arXiv:2508.15313},
  year   = {2025}
}