对齐区域包用于开放词汇目标检测
计算机视觉与模式识别
2023-02-28 v1
摘要
预训练的视觉-语言模型(VLMs)在大规模数据集上学习对齐视觉与语言表示,其中每个图像-文本对通常包含一包语义概念。然而,现有的开放词汇目标检测器仅将区域嵌入与VLMs提取的相应特征逐个对齐。这种设计虽可能被VLMs隐式学习,却未充分利用场景中语义概念的组合结构。在本工作中,我们提出超越单个区域对齐区域包的嵌入。所提方法将上下文相关的区域分组为一包。包中区域的嵌入被视为句子中词的嵌入,并被送入VLM的文本编码器以获得区域包嵌入,其被学习为与冻结VLM提取的相应特征对齐。应用于常用的Faster R-CNN,我们的方法在开放词汇COCO和LVIS基准的新类别上分别以4.6 box AP50和2.8 mask AP超越先前最佳结果。代码与模型见https://github.com/wusize/ovdet。
引用
@article{arxiv.2302.13996,
title = {Aligning Bag of Regions for Open-Vocabulary Object Detection},
author = {Size Wu and Wenwei Zhang and Sheng Jin and Wentao Liu and Chen Change Loy},
journal= {arXiv preprint arXiv:2302.13996},
year = {2023}
}