探究大型视觉-语言模型的概念理解能力
计算机视觉与模式识别
2024-04-29 v3
摘要
近年来,大型视觉-语言(V+L)模型在各种下游任务中取得了巨大成功。然而,这些模型是否对视觉内容具有概念性把握尚未得到充分研究。本文聚焦于这些大型 V+L 模型的概念理解。为推进该研究,我们提出了用于探查内容理解三个不同方面的新型基准数据集:1) 关系,2) 组合,以及 3) 上下文。我们的探查基于认知科学,并有助于判断 V+L 模型是否能够(例如)确定“雪上装饰着一个人”是不合理的,或是否能通过知晓某物位于海滩上而识别海滩家具。我们对许多近期最先进的 V+L 模型进行了实验,观察到这些模型大多未能展现出概念理解。本研究揭示了若干有趣见解,例如交叉注意力(cross-attention)有助于学习概念理解,且 CNN 更擅长纹理与图案,而 Transformer 更擅长颜色与形状。我们进一步利用部分见解并研究了一种简单微调技术,以三种概念理解指标为奖励,取得了有前景的初步结果。所提出的基准将推动学界更深入地探究概念理解,并促进大型 V+L 模型能力的提升。代码与数据集可在:\url{https://tinyurl.com/vlm-robustness} 获取。
引用
@article{arxiv.2304.03659,
title = {Probing Conceptual Understanding of Large Visual-Language Models},
author = {Madeline Schiappa and Raiyaan Abdullah and Shehreen Azad and Jared Claypoole and Michael Cogswell and Ajay Divakaran and Yogesh Rawat},
journal= {arXiv preprint arXiv:2304.03659},
year = {2024}
}
备注
All code and dataset is available at: https://tinyurl.com/vlm-robustness. Accepted in CVPRW 2024