中文

基于有向场景图的大型视觉语言模型基准测试

计算机视觉与模式识别 2025-03-27 v3

摘要

生成理解图像中文本丰富视觉内容的详细描述符文接收越来越多的关注。然而,鲜有研究开发针对详细描述的基准测试,以衡量其准确性和全面性。在本文中,我们引入了一个详细描述基准,称为CompreCap,用于从有向场景图的视角评估视觉上下文。具体而言,我们首先根据常见对象词汇表将图像手动分割为语义上有意义的区域(即语义分割掩码),同时区分这些区域中对象的属性。然后对这些对象的方向关系标签进行标注,以构建一个能够很好地编码图像中丰富组成信息的有向场景图。基于我们的有向场景图,我们开发了一个管道,用于在多个层面上评估来自大型视觉语言模型(LVLMs)的生成详细描述,包括对象层面的覆盖率、属性描述的准确性、关键关系的得分等。在CompreCap数据集上的实验结果确认,我们的评估方法在LVLMs之间与人类评估分数高度一致。

关键词

引用

@article{arxiv.2412.08614,
  title  = {Benchmarking Large Vision-Language Models via Directed Scene Graph for Comprehensive Image Captioning},
  author = {Fan Lu and Wei Wu and Kecheng Zheng and Shuailei Ma and Biao Gong and Jiawei Liu and Wei Zhai and Yang Cao and Yujun Shen and Zheng-Jun Zha},
  journal= {arXiv preprint arXiv:2412.08614},
  year   = {2025}
}

备注

Accepted by CVPR2025. Code and Dataset: https://github.com/LuFan31/CompreCap