中文

细节之处见真章:评测开放词汇目标检测器对细粒度理解的能力

计算机视觉与模式识别 2024-04-09 v2 人工智能 机器学习

摘要

大规模视觉-语言模型的最新进展实现了开放词汇场景下的视觉目标检测,其中目标类别在推理时以自由文本格式定义。在本文中,我们旨在探究最先进的开放词汇目标检测方法,以确定它们在多大程度上理解目标及其部件的细粒度属性。为此,我们引入了一种基于动态词汇生成的评测协议,以测试模型在存在难负类的情况下是否能检测、辨别目标并为其分配正确的细粒度描述。我们贡献了一套难度递增、并探查颜色、纹理和材质等不同属性的基准套件。我们进一步使用所提协议评测若干最先进的开放词汇目标检测器,发现大多数在标准开放词汇基准中表现出色的现有方案,难以准确捕捉和区分更精细的目标细节。我们在文末指出了当前方法的局限性,并探讨了克服上述缺陷的有前景的研究方向。数据和代码见 https://lorebianchi98.github.io/FG-OVD/。

关键词

引用

@article{arxiv.2311.17518,
  title  = {The devil is in the fine-grained details: Evaluating open-vocabulary object detectors for fine-grained understanding},
  author = {Lorenzo Bianchi and Fabio Carrara and Nicola Messina and Claudio Gennaro and Fabrizio Falchi},
  journal= {arXiv preprint arXiv:2311.17518},
  year   = {2024}
}

备注

Accepted as Highlight at CVPR2024