中文

LVLM-Interpret:大型视觉语言模型的可解释性工具

计算机视觉与模式识别 2024-06-26 v3

摘要

在人工智能快速发展的格局中,多模态大型语言模型正成为一个引人关注的重要领域。这些结合了多种形式数据输入的模型正变得越来越受欢迎。然而,理解其内部机制仍然是一项复杂的任务。可解释性工具和机制领域已取得诸多进展,但仍有许多值得探索的地方。在本工作中,我们提出了一种新颖的交互式应用程序,旨在理解大型视觉语言模型的内部机制。我们的界面旨在增强对图像块的解释能力,这些图像块在生成答案时起着关键作用,并评估语言模型将其输出基于图像的有效性。通过我们的应用程序,用户可以系统地调查模型并发现系统的局限性,从而为系统功能的增强铺平道路。最后,我们提供了一个案例研究,展示我们的应用程序如何帮助理解一种流行的大型多模态模型 LLaVA 中的失败机制。

关键词

引用

@article{arxiv.2404.03118,
  title  = {LVLM-Interpret: An Interpretability Tool for Large Vision-Language Models},
  author = {Gabriela Ben Melech Stan and Estelle Aflalo and Raanan Yehezkel Rohekar and Anahita Bhiwandiwalla and Shao-Yen Tseng and Matthew Lyle Olson and Yaniv Gurwicz and Chenfei Wu and Nan Duan and Vasudev Lal},
  journal= {arXiv preprint arXiv:2404.03118},
  year   = {2024}
}