中文

状态基准 (STATUS Bench):面向视觉语言模型的对象状态理解的严格基准测试

计算机视觉与模式识别 2025-10-28 v1 人工智能 多媒体

摘要

对象状态识别旨在识别对象specific condition,例如位置状态(如开或关)和功能状态(如开或关)。虽然近期的视觉语言模型(VLM)能够执行多种多模态任务,但仍不清楚它们是否能够精确识别对象状态。为缓解此问题,我们引入了状态与转换理解基准测试(STAte and Transition UnderStanding Benchmark, STATUS Bench),这是第一个严格评估视觉语言模型理解对象状态细微变化能力的基准测试。具体而言,STATUS Bench 引入了一种新颖的评估方案,要求视觉语言模型同时执行三个任务:对象状态识别(OSI)、图像检索(IR)和状态变化识别(SCI)。这些任务定义在我们构建完善的数据集上,涉及图像对、相应的对象状态描述和状态变化描述。此外,我们引入了大规模训练数据集,即 STATUS Train,包含1300万个半自动创建的描述。该数据集是促进该领域进一步研究的最大资源。在我们的实验中,我们证明 STATUS Bench 能够实现严格的一致性评估,并揭示当前最先进的视觉语言模型在捕捉对象状态细微区别方面仍存在显著困难。令人惊讶的是,在提出的严格评估方案下,大多数开源视觉语言模型仅表现出接近随机水平的零样本性能。经过在 STATUS Train 上的微调后,Qwen2.5-VL 的性能可与 Gemini 2.0 Flash 持平。这一发现凸显了 STATUS Bench 和 Train 对推进视觉语言模型中的对象状态识别具有必要性。

关键词

引用

@article{arxiv.2510.22571,
  title  = {STATUS Bench: A Rigorous Benchmark for Evaluating Object State Understanding in Vision-Language Models},
  author = {Mahiro Ukai and Shuhei Kurita and Nakamasa Inoue},
  journal= {arXiv preprint arXiv:2510.22571},
  year   = {2025}
}