中文

面向分类学的视觉语言模型评估

计算机视觉与模式识别 2025-04-09 v1

摘要

当视觉语言模型(VLM)被提示识别图像中 depicted 的实体时,可能会回答“我看到一棵阔树”,而非具体标签“挪威松”。这引发两个评估问题:首先,未受约束的生成文本需要映射到评估标签空间(即“阔树”);其次,有效的分类度量应对 less-specific 但 not incorrect 的答案(“挪威松”是“阔树”的一种)给予部分信用。为满足这些要求,我们提出了一个评估框架,用于对 unconstrained text predictions(如来自视觉语言模型的预测)进行分类学评估。具体而言,我们提出使用分层精确率和召回率度量,以评估预测在分类学上的正确性和 specificity。实验方面,我们首先展示现有文本相似性度量未能很好地捕捉分类学相似性。随后,我们开发并比较不同方法,将文本 VLM 预测映射到分类学上。这使得我们能够计算生成文本与 ground truth 标签之间的分层相似性度量。最后,我们在基于所提分类学评估方案的 fine-grained visual classification 任务中分析现代 VLM。

关键词

引用

@article{arxiv.2504.05457,
  title  = {Taxonomy-Aware Evaluation of Vision-Language Models},
  author = {Vésteinn Snæbjarnarson and Kevin Du and Niklas Stoehr and Serge Belongie and Ryan Cotterell and Nico Lang and Stella Frank},
  journal= {arXiv preprint arXiv:2504.05457},
  year   = {2025}
}

备注

CVPR 2025