中文

视觉-语言模型时代的开放集识别

计算机视觉与模式识别 2024-07-22 v2

摘要

用于开放词汇感知的视觉-语言模型(VLMs)是否因为是在互联网规模的数据集上训练而天生就是开放集模型?我们对此问题给出了明确的否定回答——VLMs 通过其有限的查询集引入了闭集假设,使其在开放集条件下易受攻击。我们系统地评估了 VLMs 在开放集识别中的表现,发现它们经常错误分类不在其查询集中的物体,导致在针对高召回率调优时精度低得惊人,反之亦然。我们表明,天真地增加查询集的大小以包含越来越多的类别并不能缓解这个问题,反而会导致任务性能和开放集性能下降。我们为 VLM 时代确立了开放集问题的修订定义,定义了一个新的基准和评估协议以促进这一重要领域的标准化评估和研究,并在一系列开放词汇 VLM 分类器和物体检测器上评估了基于预测不确定性和专用负嵌入的有前景的基线方法。

关键词

引用

@article{arxiv.2403.16528,
  title  = {Open-Set Recognition in the Age of Vision-Language Models},
  author = {Dimity Miller and Niko Sünderhauf and Alex Kenna and Keita Mason},
  journal= {arXiv preprint arXiv:2403.16528},
  year   = {2024}
}

备注

29 pages, Accepted for publication in ECCV 2024