MVP-Bench:大型视觉语言模型是否能像人类一样进行多层次视觉感知?
计算机视觉与模式识别
2024-10-08 v1 人工智能
摘要
人类在视觉感知中会进行多层次处理,包括低层次的对象识别和高层次的语义解释,如行为理解。低层次细节的微小差异可能导致高层次感知的重大变化。例如,将持有购物袋的人替换为持枪的人,会暗示暴力行为,进而暗示犯罪或暴力活动。尽管各类多模态任务取得了显著进展,但大型视觉语言模型(LVLMs)在进行此类多层次视觉感知方面的能力仍未被探讨。为调查LVLMs与人类之间的感知差距,我们引入MVP-Bench——第一个系统评估LVLMs低级与高级视觉感知的视觉语言基准测试。我们在自然图像和合成图像上构建MVP-Bench,探讨操纵内容如何影响模型感知。使用MVP-Bench,我们诊断了10个开源及2个闭源LVLMs的视觉感知能力,发现高层次感知任务对现有LVLMs构成重大挑战。最先进的GPT-4o在Yes/No题目上准确率仅为56%,远低于低层次场景的74%。此外,自然图像与操纵图像之间的性能差距表明,当前LVLMs尚未能像人类一样理解合成图像的视觉语义。我们的数据和代码已公开于https://github.com/GuanzhenLi/MVP-Bench。
引用
@article{arxiv.2410.04345,
title = {MVP-Bench: Can Large Vision--Language Models Conduct Multi-level Visual Perception Like Humans?},
author = {Guanzhen Li and Yuxi Xie and Min-Yen Kan},
journal= {arXiv preprint arXiv:2410.04345},
year = {2024}
}