面向无隐蔽目标分割的零样本方法
计算机视觉与模式识别
2026-03-03 v2
摘要
隐蔽目标分割(COS)面临数据标注稀缺的重大挑战,由于目标与背景之间复杂的边界,像素级标注既费时又费钱。针对核心问题"在无任何隐蔽目标标注的情况下,COS能否有效实现?"本文给出肯定回答,提出一种鲁棒的零样本COS框架。该框架利用COS内在的局部模式偏差,借助显著目标分割(SOS)中的宽语义特征空间实现高效零样本迁移。我们引入基于掩码图像建模(MIM)的图像编码器,针对参数高效微调(PEFT)进行优化;结合多模态大语言模型(M-LLM)和多尺度细粒度对齐(MFA)机制。MIM预训练的图像编码器专注于捕获关键低层特征,而M-LLM生成的描述嵌入与这些视觉线索一起处理。通过MFA实现精确对齐,使框架能够准确解读和导航复杂的语义上下文。为优化操作效率,我们引入可学习的码本在推理阶段代表M-LLM,显著降低计算开销。我们的框架通过严格实验验证展现出 versatility与效能,在零样本COS任务中实现了最先进的性能,CAMO数据集上F得分达72.9%,COD10K数据集上达71.7%。通过移除M-LLM即可实现推理速度与传统端到端模型相当,达到18.1 FPS。代码:https://github.com/AVC2-UESTC/ZSCOS-CaMF
引用
@article{arxiv.2410.16953,
title = {Towards Real Zero-Shot Camouflaged Object Segmentation without Camouflaged Annotations},
author = {Cheng Lei and Jie Fan and Xinran Li and Tianzhu Xiang and Ao Li and Ce Zhu and Le Zhang},
journal= {arXiv preprint arXiv:2410.16953},
year = {2026}
}