探索多模态大语言模型的感知局限性
计算机视觉与模式识别
2024-02-13 v1 人工智能
机器学习
摘要
多模态大语言模型(MLLMs)最近在回答视觉问题方面显示出卓越的感知能力,但关于其感知局限性的了解仍很有限。特别是,尽管先前的工作提供了MLLMs对对象大小敏感性的 anecdotal evidence,但尚未全面探索这一现象及其背后的原因。在本工作中,我们定量研究了几种最先进的MLLMs对小视觉对象的感知,并揭示了回答图像中小对象问题时存在普遍的局限性。接下来,我们识别出四个独立因素可贡献于这一局限——对象质量、大小、干扰项和位置——并进行受控干预研究,以衡量每个因素对MLLMs感知的影响。特别是,我们发现较低的对象质量和较小的对象大小都可以独立地降低MLLMs回答视觉问题的能力。更令人惊讶的是,我们发现对象在图像中的位置以及视觉干扰项的存在也会显著降低MLLMs的问答准确率。我们的研究提供了更好的对MLLMs感知局限性的理解,并为分析未来MLLMs的感知贡献了新的评估协议。为促进进一步的调查,我们发布了代码和数据。
引用
@article{arxiv.2402.07384,
title = {Exploring Perceptual Limitation of Multimodal Large Language Models},
author = {Jiarui Zhang and Jinyi Hu and Mahyar Khayatkhoei and Filip Ilievski and Maosong Sun},
journal= {arXiv preprint arXiv:2402.07384},
year = {2024}
}
备注
14 pages, 14 figures, 3 tables