Argus能否全能评判?跨域比较视觉语言模型
信息检索
2025-07-03 v1 人工智能
计算与语言
摘要
视觉语言模型(VLM)正在推动多模态AI的发展,但其在不同任务中的性能一致性尚未得到充分考察。我们对CLIP、BLIP和LXMERT进行了跨数据集的基准测试,涵盖检索、描述和推理等任务。我们的评估包括任务准确率、生成质量、效率以及一种新颖的跨数据集一致性(CDC)指标。CLIP显示出最强的泛化能力(CDC: 0.92),BLIP在精选数据上表现突出,LXMERT在结构化推理方面领先。这些结果揭示了泛化性与专业化之间的权衡,为工业部署VLMs并指导开发面向稳健、任务灵活架构的发展提供了指导。
引用
@article{arxiv.2507.01042,
title = {Can Argus Judge Them All? Comparing VLMs Across Domains},
author = {Harsh Joshi and Gautam Siddharth Kashyap and Rafiq Ali and Ebad Shabbir and Niharika Jain and Sarthak Jain and Jiechao Gao and Usman Naseem},
journal= {arXiv preprint arXiv:2507.01042},
year = {2025}
}