真实世界中的视觉语言模型:弥合学术基准与企业现实之间的差距
计算机视觉与模式识别
2025-09-10 v1 计算与语言
摘要
开源视觉语言模型在企业应用中展现出巨大潜力,然而学术评估与企业部署需求之间存在着严重的脱节。当前的基准严重依赖多项选择题和合成数据,未能捕捉现实世界商业应用(如社交媒体内容分析)的复杂性。本文提出了 VLM-in-the-Wild (ViLD),这是一个通过在运营企业需求上评估 VLM 来弥合这一差距的综合框架。我们定义了十项业务关键任务:标志检测、OCR、目标检测、人员存在与人口统计分析、人类活动与外观分析、场景检测、相机视角与媒体质量评估、主色调、综合描述以及 NSFW 检测。在该框架中,我们引入了创新的 BlockWeaver 算法,解决了在不依赖嵌入或 LLM 的情况下,比较来自 VLM 的无序、可变分组 OCR 输出这一极具挑战性的问题,实现了出色的速度与可靠性。为了验证 ViLD 的有效性,我们构建了一个包含 7500 个多样化样本的新基准数据集,这些样本是从一百万个真实世界图像和视频语料库中仔细分层抽样得到的。ViLD 通过结合语义匹配(基于嵌入的方法和 LLM-as-a-judge 方法)、传统指标以及测量描述性输出的完整性与忠实度的新方法,提供可操作的洞察。通过按照 ViLD 框架将领先的开源 VLM(Qwen、MIMO 和 InternVL)与强大的专有基线进行基准测试,我们提供了首批基于行业、任务驱动的 VLM 能力评估之一,为其在企业环境中的部署提供了可操作的洞察。
引用
@article{arxiv.2509.06994,
title = {VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality},
author = {Srihari Bandraupalli and Anupam Purwar},
journal= {arXiv preprint arXiv:2509.06994},
year = {2025}
}