面向大型视觉语言模型的OODBench基准测试
计算机视觉与模式识别
2026-02-23 v1 人工智能
数据库
摘要
现有的视觉语言模型(VLM)通过在大规模数据集上进行训练取得了显著进展,通常假设数据独立同分布(IID)。然而,在实际场景中,实际处理的全部数据满足这一假设往往不可行。此外,未能恰当地处理超出分布(OOD)对象可能在实际应用中引入安全风险(如自动驾驶或医疗辅助)。不幸的是,当前研究尚未提供能够全面评估VLM处理OOD数据能力的有效基准测试。因此,我们提出了OODBench,这是一种主要自动化、人工验证工作最小的方法,用于构建新的基准测试并评估VLM处理OOD数据能力。OODBench包含4万个实例级OOD实例-类别对,我们表明即使在底层图像类别常见的情况下,当前VLM在OODBench上仍表现出显著的性能下降。此外,我们提出了一种可靠的自动评估指标,该指标采用由易到难的提问者渐进序列,以更全面地评估OOD数据对不同难度问题的影响。最后,我们总结了大量发现和见解,以促进未来在OOD数据获取与评估方面的研究。
引用
@article{arxiv.2602.18094,
title = {OODBench: Out-of-Distribution Benchmark for Large Vision-Language Models},
author = {Ling Lin and Yang Bai and Heng Su and Congcong Zhu and Yaoxing Wang and Yang Zhou and Huazhu Fu and Jingrun Chen},
journal= {arXiv preprint arXiv:2602.18094},
year = {2026}
}
备注
54 pages, 21 figures