用于开放词汇目标检测的采样包式视角
计算机视觉与模式识别
2024-12-25 v1 人工智能
摘要
现有的开放词汇目标检测(OVD)develop方法通过对齐目标区域嵌入与相应的VLM特征来测试未见类别。 最近的一项研究利用了VLI隐式学习语义概念构成结构的想法。 它不使用单个区域嵌入,而是使用一组区域嵌入作为新的表示来将构成结构纳入OVD任务。然而,这种方法往往无法捕捉每个区域的上下文概念,导致构成结构嘈杂。这仅在边际性能改进和效率降低方面有所帮助。 为了解决这一问题,我们提出了一种新颖的概念导向对齐方法,该方法采样更有力且更高效的构成结构。我们的做法将与上下文相关的“概念”分组到一个包中,并调整包内概念的比例,以实现更有效的嵌入对齐。结合Faster R-CNN,我们的方法在开放词汇COCO和LVIS基准测试中新类别的box AP50提升了2.6个,mask AP提升了0.5个。此外,我们的方法将CLIP计算的FLOPs降低了80.3%,显著增强了效率。实验结果表明,所提出的方法在OVD数据集上超过以前的SOTA模型。
关键词
引用
@article{arxiv.2412.18273,
title = {Sampling Bag of Views for Open-Vocabulary Object Detection},
author = {Hojun Choi and Junsuk Choe and Hyunjung Shim},
journal= {arXiv preprint arXiv:2412.18273},
year = {2024}
}
备注
19 pages