无需训练的开放式目标检测与分割:以注意力图为提示
计算机视觉与模式识别
2024-10-10 v1
摘要
现有的感知模型通过从大量标注数据中学习取得了巨大成功,但在开放世界场景中仍面临挑战。为缓解此问题,研究者引入了开放集感知任务来检测或分割训练集中未见过的目标。然而,这些模型在推理时需要预定义的目标类别作为输入,这在现实场景中并不可用。近期,研究者提出了一个更新且更实际的问题,即开放式目标检测,它无需任何目标类别作为输入即可发现未见目标。在本文中,我们提出了VL-SAM,一个无需训练的框架,它结合了通用目标识别模型(即视觉-语言模型)和通用目标定位模型(即分割一切模型),以解决开放式目标检测与分割任务。无需额外训练,我们通过注意力图作为提示来连接这两个通用模型。具体来说,我们设计了一个注意力图生成模块,采用头部聚合和正则化注意力流来聚合和传播VLM中所有头部和层的注意力图,从而生成高质量的注意力图。然后,我们通过提示生成模块从注意力图中迭代采样正负点,并将采样点发送给SAM以分割相应的目标。在长尾实例分割数据集(LVIS)上的实验结果表明,我们的方法在目标检测任务上超越了先前的开放式方法,并能提供额外的实例分割掩码。此外,VL-SAM在边缘案例目标检测数据集(CODA)上取得了良好的性能,证明了VL-SAM在实际应用中的有效性。而且,VL-SAM展现出良好的模型泛化能力,可以整合各种VLM和SAM。
引用
@article{arxiv.2410.05963,
title = {Training-Free Open-Ended Object Detection and Segmentation via Attention as Prompts},
author = {Zhiwei Lin and Yongtao Wang and Zhi Tang},
journal= {arXiv preprint arXiv:2410.05963},
year = {2024}
}
备注
Accepted by NeurIPS 2024