NPHardEval4V:具有视觉效应的大型视觉 - 语言模型动态评估
计算与语言
2025-08-28 v3 计算机视觉与模式识别
摘要
大型视觉 - 语言模型(LVLMs)在多模态理解方面展示了令人印象深刻的能力,但其推理能力仍未得到充分探索。现有的基准测试往往侧重于感知或基于文本的理解,对于这些模型在需要视觉和语言推理的结构化、逻辑驱动任务上的表现提供的见解有限。为了弥补这一差距,我们引入了 NPHardEval4V,这是一个基于四个经典 NP 难问题(背包问题、集合覆盖问题、旅行商问题和顶点覆盖问题)的多模态基准测试套件。每个任务都通过结构化视觉布局和文本提示的组合呈现,旨在评估 LVLMs 在视觉 - 语言约束下执行组合推理的能力。我们在统一的提示和问题表示框架下评估了一组先进的开源和闭源视觉 - 语言模型。这使得跨模型和任务类型的公平比较成为可能,同时隔离了影响性能的关键变量。我们的结果表明,虽然这些模型在基于感知的输入上表现尚可,但在全局优化、抽象和约束满足方面存在困难。没有任何单一模型在所有问题类型上表现出一致的推理能力,常见的失败模式揭示了当前架构的根本局限性。通过利用 NP 难问题的结构和复杂性,NPHardEval4V 为诊断 LVLMs 中的推理行为提供了一个可扩展、可解释且具有挑战性的测试平台。我们希望该基准能够支持社区构建更鲁棒、具备推理能力的多模态系统。基准数据集和代码可在 https://github.com/lizhouf/NPHardEval4 获取。
引用
@article{arxiv.2403.01777,
title = {NPHardEval4V: Dynamic Evaluation of Large Vision-Language Models with Effects of Vision},
author = {Xiang Li and Wenyue Hua and Kaijie Zhu and Lingyao Li and Haoyang Ling and Jinkui Chi and Qi Dou and Jindong Wang and Yongfeng Zhang and Xin Ma and Lizhou Fan},
journal= {arXiv preprint arXiv:2403.01777},
year = {2025}
}
备注
25 pages, 9 figures, 2 tables