面向目标检测与分割的视觉语言模型:综述与评估
人工智能
2025-10-14 v2 计算与语言
摘要
视觉语言模型(VLM)在开放词汇(OV)目标检测和分割任务中获得了广泛采用。尽管它们在 OV 相关任务上表现出色,但在传统视觉任务中的有效性尚未得到评估。本文系统性地综述了 VLM 基于检测和分割的方法,将 VLM 视为基础模型,并首次对多个下游任务进行全面评估:1)评估涵盖八种检测情景(封闭集检测、域适应、拥挤目标等)和八种分割情景(少样本、开放世界、小目标等),揭示了各种 VLM 架构在不同任务中的 distinct performance advantages and limitations。2)在检测任务方面,我们在三种 fine-tuning 粒度下评估 VLM:zero prediction、visual fine-tuning 和 text prompt,并进一步分析不同 fine-tuning 策略在不同任务下的性能影响。3)基于实证发现,我们深入分析了任务特征、模型架构与训练方法之间的相关性,为未来 VLM 设计提供了洞见。4)我们相信本工作对从事计算机视觉、多模态学习和视觉基础模型领域的模式识别专家具有重要价值,通过介绍问题、熟悉当前进展状况并为未来研究提供可行方向。与本综述和评估相关的项目已创建于 https://github.com/better-chao/perceptual_abilities_evaluation。
引用
@article{arxiv.2504.09479,
title = {Draw with Thought: Unleashing Multimodal Reasoning for Scientific Diagram Generation},
author = {Zhiqing Cui and Jiahao Yuan and Hanqing Wang and Yanshu Li and Chenxu Du and Zhenglong Ding},
journal= {arXiv preprint arXiv:2504.09479},
year = {2025}
}
备注
10 pages, 5 figures, accepted to appear in the Proceedings of the 33rd ACM International Conference on Multimedia (MM '25)