中文

如何评估检测模型的泛化能力?一个面向开放词汇检测的全面评测基准

计算机视觉与模式识别 2023-12-19 v2 计算与语言

摘要

计算机视觉中的目标检测(OD)近年来取得了显著进展,从闭集标签过渡到基于大规模视觉-语言预训练(VLP)的开放词汇检测(OVD)。然而,当前的评估方法和数据集仅限于测试对物体类别和指代表达的泛化能力,无法对 OVD 模型的能力提供系统、细粒度且准确的基准。本文提出一个名为 OVDEval 的新基准,包含 9 个子任务,并引入对常识知识、属性理解、位置理解、物体关系理解等方面的评测。该数据集经过精心构建,提供困难负样本以挑战模型对视觉与语言输入的真正理解。此外,我们发现流行的平均精度(AP)指标在细粒度标签数据集上评测模型时存在问题,并提出一种称为非极大值抑制平均精度(NMS-AP)的新指标来解决该问题。大量实验结果表明,现有顶尖 OVD 模型除简单物体类别外均在新任务上失败,证明了所提数据集在定位当前 OVD 模型弱点并指导未来研究方面的价值。进一步,实验验证了所提 NMS-AP 指标能更真实地评估 OVD 模型,而传统 AP 指标会产生误导性结果。数据见 \url{https://github.com/om-ai-lab/OVDEval}

关键词

引用

@article{arxiv.2308.13177,
  title  = {How to Evaluate the Generalization of Detection? A Benchmark for Comprehensive Open-Vocabulary Detection},
  author = {Yiyang Yao and Peng Liu and Tiancheng Zhao and Qianqian Zhang and Jiajia Liao and Chunxin Fang and Kyusong Lee and Qing Wang},
  journal= {arXiv preprint arXiv:2308.13177},
  year   = {2023}
}

备注

Long paper accepted at AAAI 2024