中文

近期大型视觉 - 语言模型的有效性评估

计算机视觉与模式识别 2024-10-29 v5 人工智能 机器学习

摘要

大型视觉 - 语言模型(LVLMs)的出现代表了追求通用人工智能的显著进步。然而,该模型在专用任务和通用任务中的有效性值得进一步调查。本文致力于分别评估流行 LVLMs 在专用任务和通用任务中的能力,旨在提供对这些新型模型的全面理解。为了衡量它们在专用任务中的有效性,我们在自然、医疗和工业三个不同的应用场景中采用了六项具有挑战性的任务。这六项任务包括显著/伪装/透明物体检测,以及息肉检测、皮肤病变检测和工业异常检测。我们检查了三种近期开源 LVLMs(包括 MiniGPT-v2、LLaVA-1.5 和 Shikra)在这些任务中的视觉识别和定位性能。此外,我们利用上述 LVLMs 以及 GPT-4V 进行了实证调查,评估了它们在通用任务中的多模态理解能力,包括物体计数、荒谬问题回答、功能推理、属性识别和空间关系推理。我们的调查显示,这些 LVLMs 不仅在专用任务中表现出有限的能力,在通用任务中也是如此。我们深入探讨了这种不足,并揭示了几个潜在因素,包括在专用任务中的认知有限、物体幻觉、文本到图像的干扰以及在复杂问题中鲁棒性的下降。我们希望本研究能为 LVLMs 的未来发展提供有用的见解,帮助研究人员改进 LVLMs 以适用于通用和专用应用。

关键词

引用

@article{arxiv.2403.04306,
  title  = {Effectiveness Assessment of Recent Large Vision-Language Models},
  author = {Yao Jiang and Xinyu Yan and Ge-Peng Ji and Keren Fu and Meijun Sun and Huan Xiong and Deng-Ping Fan and Fahad Shahbaz Khan},
  journal= {arXiv preprint arXiv:2403.04306},
  year   = {2024}
}

备注

Accepted by Visual Intelligence