中文

面向共显著物体检测的视觉共识提示

计算机视觉与模式识别 2025-04-22 v1

摘要

现有的共显著物体检测(CoSOD)方法通常采用三级架构(即编码、共识提取与扩散、预测),并配合典型的全参数微调范式。虽然它们带来了某些好处,但存在两个显著局限:1) 该架构依赖编码特征来促进共识提取,但精心提取的共识未能及时指导编码阶段。2) 该范式涉及全局更新模型的所有参数,导致参数效率低下,阻碍了为该任务有效表示基座模型中的知识。因此,本文提出了一种交互有效且参数高效的简洁架构,以解决上述两个关键局限。它首次引入参数高效的提示调优范式,并无缝将共识嵌入提示中,以形成特定任务的视觉共识提示(VCP)。我们的VCP旨在通过构建特定于任务的视觉共识提示,最小化可调参数,诱导冻结的基座模型在CoSOD任务上获得更好性能。具体而言,精心设计的共识提示生成器(CPG)的核心思想是:强制限定可调参数聚焦于共显著表示,生成共识提示。所构建的共识提示扩散器(CPD)利用共识提示形成特定于任务的视觉共识提示,从而唤醒预训练模型在解决CoSOD任务方面的强大潜力。广泛实验表明,我们简洁的VCP超过13个最先进的全参数微调模型,实现了新的最佳性能(在最具挑战性的CoCA数据集上F_m指标提升6.8%)。源代码已公开:https://github.com/WJ-CV/VCP。

关键词

引用

@article{arxiv.2504.14254,
  title  = {Visual Consensus Prompting for Co-Salient Object Detection},
  author = {Jie Wang and Nana Yu and Zihao Zhang and Yahong Han},
  journal= {arXiv preprint arXiv:2504.14254},
  year   = {2025}
}

备注

CVPR 2025