中文

VRPTEST:评估大型多模态模型中的视觉指代提示

计算机视觉与模式识别 2023-12-08 v1 人工智能

摘要

随着大型多模态模型在各个领域的最新进展,一种称为视觉指代提示的新型提示方法应运而生,在增强多模态系统中的人机交互方面显示出巨大潜力。与传统的文本描述或坐标相比,该方法提供了与这些系统进行人机交互的更自然和灵活的方式。然而,视觉指代提示的分类尚未定义,其对大型多模态模型性能的影响也尚未得到正式检验。在本研究中,我们首次使用多种视觉指代提示策略对大型多模态模型进行了全面分析。我们引入了一个名为VRPTEST的基准数据集,包含3种不同的视觉任务和2275张图像,涵盖了多种提示策略组合。利用VRPTEST,我们对八个版本的著名开源和专有基础模型(包括两个早期版本的GPT-4V)进行了全面评估。我们开发了一个基于软件蜕变测试技术的自动化评估框架,以评估大型多模态模型的准确性,无需人工干预或手动标注。我们发现,当前的专有模型通常优于开源模型,平均准确率提高了22.70%;然而,仍有改进空间。此外,我们的定量分析表明,提示策略的选择显著影响大型多模态模型的准确性,变化范围从-17.5%到+7.3%。进一步的案例研究表明,合适的视觉指代提示策略可以增强大型多模态模型对上下文和位置信息的理解,而不合适的策略可能导致答案拒绝。我们还提供了关于最小化视觉指代提示对大型多模态模型负面影响的见解。

关键词

引用

@article{arxiv.2312.04087,
  title  = {VRPTEST: Evaluating Visual Referring Prompting in Large Multimodal Models},
  author = {Zongjie Li and Chaozheng Wang and Chaowei Liu and Pingchuan Ma and Daoyuan Wu and Shuai Wang and Cuiyun Gao},
  journal= {arXiv preprint arXiv:2312.04087},
  year   = {2023}
}

备注

13 pages