中文

MM-SAP:评估多模态大语言模型感知自我意识的综合基准

计算机视觉与模式识别 2024-06-04 v3 计算与语言

摘要

多模态大语言模型(MLLMs)的最新进展在视觉感知与理解方面展现出卓越能力。然而,这些模型也饱受幻觉困扰,这限制了其作为AI系统的可靠性。我们认为,这些幻觉部分源于模型难以理解自身能从图像中感知什么、不能感知什么,我们将这种能力称为感知自我意识。尽管其重要性不言而喻,MLLMs的这一方面在先前研究中一直被忽视。本文旨在定义并评估MLLMs的感知自我意识。为此,我们首先引入感知知识象限,帮助界定MLLMs对图像知道什么与不知道什么。基于此框架,我们提出一个新颖的基准——MLLMs感知自我意识基准(MM-SAP),专门用于评估这一能力。我们将MM-SAP应用于多种流行的MLLMs,全面分析其自我意识并提供详细见解。实验结果表明,当前MLLMs的自我意识能力有限,这为未来开发可信赖的MLLMs指明了一个关键方向。代码与数据见https://github.com/YHWmz/MM-SAP。

关键词

引用

@article{arxiv.2401.07529,
  title  = {MM-SAP: A Comprehensive Benchmark for Assessing Self-Awareness of Multimodal Large Language Models in Perception},
  author = {Yuhao Wang and Yusheng Liao and Heyang Liu and Hongcheng Liu and Yu Wang and Yanfeng Wang},
  journal= {arXiv preprint arXiv:2401.07529},
  year   = {2024}
}