COREVQA:面向人群观察与推理蕴含的视觉问答基准
计算机视觉与模式识别
2025-07-21 v1 机器学习
摘要
近期,许多基准和数据集被开发出来,用于通过视觉问答(VQA)对来评估视觉语言模型(VLM),并且模型已显示出显著的准确率提升。然而,这些基准很少测试模型准确完成视觉蕴含的能力,例如,基于图像接受或反驳一个假设。为解决此问题,我们提出了COREVQA(人群观察与推理蕴含),一个包含5608张图像和合成生成的真/假陈述对的基准,图像源自CrowdHuman数据集,旨在引发对具有挑战性的拥挤图像的视觉蕴含推理。我们的结果表明,即使是表现最好的VLM,其准确率也低于80%,其他模型的表现则更差(39.98%-69.95%)。这一显著的性能差距揭示了VLM在拥挤场景中对特定类型的图像-问题对进行推理的能力存在关键局限性。
引用
@article{arxiv.2507.13405,
title = {COREVQA: A Crowd Observation and Reasoning Entailment Visual Question Answering Benchmark},
author = {Ishant Chintapatla and Kazuma Choji and Naaisha Agarwal and Andrew Lin and Hannah You and Charles Duong and Kevin Zhu and Sean O'Brien and Vasu Sharma},
journal= {arXiv preprint arXiv:2507.13405},
year = {2025}
}