大型视觉语言模型属性理解能力评估
计算机视觉与模式识别
2024-08-27 v1
摘要
目前,大型视觉语言模型在许多下游任务上取得了令人期待的进展。然而,它们在细粒度视觉理解任务中仍面临诸多挑战,例如对象属性理解。此外,尽管已有越来越多的工作致力于大型视觉语言模型的评估,但缺乏对属性理解及视觉语言微调过程的深入研究。本文我们提出从两个角度评估大型视觉语言模型的属性理解能力:属性识别与属性层次理解。我们评估了三种视觉语言交互方式,包括视觉问答、图像文本匹配和图像文本余弦相似度。进一步,我们探讨了微调过程中影响属性理解的因素。通过一系列定量与定性实验,我们引入了三个主要发现:(1)大型视觉语言模型具备良好的属性识别能力,但其层次化理解能力相对有限。(2)与ITC相比,ITM在捕捉更细节方面表现出色,更适合属性理解任务。(3)用于微调的图像文本描述中的属性信息在属性理解中发挥关键作用。我们希望本工作能为推动大型视觉语言模型在细粒度视觉理解方面的发展提供指导。
引用
@article{arxiv.2408.13898,
title = {Evaluating Attribute Comprehension in Large Vision-Language Models},
author = {Haiwen Zhang and Zixi Yang and Yuanzhi Liu and Xinran Wang and Zheqi He and Kongming Liang and Zhanyu Ma},
journal= {arXiv preprint arXiv:2408.13898},
year = {2024}
}
备注
15 pages, 4 figures