中文

基于视觉提示的开放集检测预训练模型探索

计算机视觉与模式识别 2023-12-15 v1

摘要

文本提示对于将预训练的开放集目标检测模型泛化到新类别至关重要。然而,当前的文本提示方法存在局限性,因为它们在泛化到新类别时需要人工反馈,这限制了它们对复杂场景的建模能力,往往导致错误的检测结果。为了解决这一局限性,我们提出了一种新颖的视觉提示方法,该方法从少量标记图像中学习新类别知识,从而将预训练检测模型泛化到新类别。为了使视觉提示能够充分表示新类别,我们提出了一种基于统计的提示构建模块,该模块不受预定义词汇长度的限制,从而允许在表示类别时使用更多向量。我们进一步利用预训练数据集中的类别字典来设计特定任务的相似度字典,使视觉提示更具判别力。我们在 ODinW 数据集上评估了该方法,结果表明它优于现有的提示学习方法,并且在组合推理中表现更为一致。

关键词

引用

@article{arxiv.2312.08839,
  title  = {Exploration of visual prompt in Grounded pre-trained open-set detection},
  author = {Qibo Chen and Weizhong Jin and Shuchang Li and Mengdi Liu and Li Yu and Jian Jiang and Xiaozheng Wang},
  journal= {arXiv preprint arXiv:2312.08839},
  year   = {2023}
}

备注

Accepted at ICASSP 2024