我们真的需要 LLM+VQA 系统来识别视觉概念吗?
计算机视觉与模式识别
2024-10-18 v1
摘要
能够从少量视觉数据中学习新对象,并在新情景中产生关于某些概念(这些概念共同构成该对象)的存在/不存在的令人信服的语言解释,是一个重要的人类认知特征。这一能力是通过抽象对象所包含的属性/特性来实现的,例如,一个对象“鸟”可以由喙、羽毛、腿、翅膀等的存在来识别。鼓舞人心于此人类推理方面的这一方面,我们在本工作中提出了一个零样本框架,通过利用大型语言模型和视觉问答(VQA)系统实现精细的视觉概念学习。具体而言,我们引导 GPT-3 获取视觉对象在数据集中的丰富语言描述。我们将获得的概念描述转换为一组二进制问题。我们将这些问题以及查询图像输入到 VQA 系统,并聚合答案以确定测试图像中对象的存在或不存在。我们的实验表明,在不产生显著计算开销的前提下,本方法在性能上与现有的零样本视觉分类方法和少量样本概念学习方法相当,同时完全从推理角度提供可解释性。
引用
@article{arxiv.2410.13651,
title = {Help Me Identify: Is an LLM+VQA System All We Need to Identify Visual Concepts?},
author = {Shailaja Keyur Sampat and Maitreya Patel and Yezhou Yang and Chitta Baral},
journal= {arXiv preprint arXiv:2410.13651},
year = {2024}
}
备注
14 pages, 7 figures