开放词汇伪装目标分割
计算机视觉与模式识别
2024-07-08 v3
摘要
近年来,大规模视觉-语言模型(VLM,如 CLIP)的出现为开放世界目标感知开辟了道路。许多工作探索了利用预训练 VLM 来完成具有挑战性的开放词汇密集预测任务,该任务要求在推理时感知具有新颖类别的多样目标。现有方法基于相关任务的公共数据集构建实验,这些数据集并非为开放词汇量身定制,且由于数据收集偏差和标注成本,很少涉及隐藏在复杂场景中的不易察觉目标。为填补这些空白,我们引入了一项新任务——开放词汇伪装目标分割(OVCOS),并构建了一个大规模复杂场景数据集(\textbf{OVCamo}),包含 11,483 张人工筛选的图像,带有精细标注和相应的目标类别。进一步,我们建立了一个强大的单阶段开放词汇\underline{伪}装\underline{目}\underline{标}\underline{分}割\underline{器}基线 \textbf{OVCoser},其挂载在参数固定的 CLIP 上,具有迭代语义引导和结构增强。通过整合类别语义知识的引导以及来自边缘和深度信息的视觉结构线索的补充,所提方法能高效捕捉伪装目标。此外,这一有效框架在我们的 OVCamo 数据集上还大幅超越了先前开放词汇语义图像分割的最先进方法。借助所提数据集和基线,我们希望这一具有更高实用价值的新任务能进一步拓展开放词汇密集预测任务的研究。我们的代码和数据可在 \href{https://github.com/lartpang/OVCamo}{链接} 中找到。
引用
@article{arxiv.2311.11241,
title = {Open-Vocabulary Camouflaged Object Segmentation},
author = {Youwei Pang and Xiaoqi Zhao and Jiaming Zuo and Lihe Zhang and Huchuan Lu},
journal= {arXiv preprint arXiv:2311.11241},
year = {2024}
}
备注
Update details. Acceptd by ECCV 2024