PARC:揭示视觉语言模型内部对称性的量化框架
机器学习
2025-06-19 v1
摘要
视觉语言模型(VLMs)会响应用户构建的文本提示和视觉输入,并应用于诸多实际问题。VLMs 将视觉模态与大语言模型(LLMs)集成,后者因而对提示而具有敏感性。因此,关键在于确定 VLMs 是否因不同提示而呈现出不同程度的不稳定性。为此,我们介绍 PARC(Prompt Analysis via Reliability and Calibration),即基于三个支柱构建的 VLMs 提示敏感性分析框架:(1)语言和视觉领域中可信的提示变体;(2)具备保证的新型模型可靠性评分;(3)使能够进行跨数据集和跨提示范围的提示变体分析的校准步骤。关于提示变体,PARC 的评估显示 VLMs 在视觉领域中镜像 LLM 的语言提示敏感性,而大多数破坏性变体会改变预期答案。关于模型,经过评估的 22 个模型中,来自 InternVL2 系列的 VLMs 表现出突出的鲁棒性。我们进一步发现提示敏感性与训练数据之间存在关联的迹象。该代码将置于 https://github.com/NVlabs/PARC。
引用
@article{arxiv.2506.14808,
title = {PARC: A Quantitative Framework Uncovering the Symmetries within Vision Language Models},
author = {Jenny Schmalfuss and Nadine Chang and Vibashan VS and Maying Shen and Andres Bruhn and Jose M. Alvarez},
journal= {arXiv preprint arXiv:2506.14808},
year = {2025}
}
备注
Accepted to CVPR 2025