UOUO:衡量视觉语言模型知识边缘的无上下文罕见对象
计算机视觉与模式识别
2024-07-29 v1
摘要
小规模视觉语言模型 (VLMs) 常声称在一般领域视觉 grounding 和问答基准测试中与大型模型持平,同时在计算效率和存储方面具有优势。然而,其处理罕见对象(数据分布长尾)的能力尚不明了。为严格评估这一方面,我们引入“无上下文罕见对象” (UOUO) 基准测试。该基准测试聚焦系统测试 VLMs 在大型和小型参数模型中处理罕见和专业对象的能力。我们的全面分析表明,尽管小型 VLMs 在常规数据集上保持竞争性能,但在涉及罕见对象的任务中表现显著下降。我们还提出了高级、可扩展的数据收集和清洗管道,确保 UOUO 基准测试提供高质量、具挑战性的实例。这些发现凸显在评估 VLMs 真实能力时需考虑长尾分布的重要性。
引用
@article{arxiv.2407.18391,
title = {UOUO: Uncontextualized Uncommon Objects for Measuring Knowledge Horizons of Vision Language Models},
author = {Xinyu Pi and Mingyuan Wu and Jize Jiang and Haozhen Zheng and Beitong Tian and Chengxiang Zhai and Klara Nahrstedt and Zhiting Hu},
journal= {arXiv preprint arXiv:2407.18391},
year = {2024}
}
备注
10 pages