中文

信任但验证:野外环境下的程序化视觉语言模型评估

计算机视觉与模式识别 2024-10-18 v1 人工智能

摘要

视觉语言模型通常会对视觉查询生成看似合理但错误的响应。然而,可靠地量化这种幻觉在开放式查询的自由形式响应中的影响具有挑战性,因为这需要视觉验证响应中的每个声明。我们提出程序化视觉语言模型评估(PROVE),一种用于评估视觉语言模型对开放式查询响应的新基准范式。为了构建 PROVE,我们向大语言模型提供从超详细图像描述构建的高保真场景图表示,并提示其生成多样化的问答对,以及可在场景图对象上执行以验证每个问答对的程序。因此,我们构建了一个包含 10.5k 个具有挑战性但视觉上可靠的问答对的基准。接下来,为了评估 PROVE 中查询的自由形式模型响应,我们提出了一种程序化评估策略,该策略在统一的基于场景图的框架内衡量响应的有用性和真实性。我们在 PROVE 上基准测试了一系列视觉语言模型的有用性-真实性权衡,发现实际上很少有模型能够在两者之间取得良好平衡。项目页面:\url{https://prove-explorer.netlify.app/}。

关键词

引用

@article{arxiv.2410.13121,
  title  = {Trust but Verify: Programmatic VLM Evaluation in the Wild},
  author = {Viraj Prabhu and Senthil Purushwalkam and An Yan and Caiming Xiong and Ran Xu},
  journal= {arXiv preprint arXiv:2410.13121},
  year   = {2024}
}