理解多模态 LLM:Llava 在视觉问答中的机制可解释性
计算与语言
2025-01-14 v2
摘要
理解大型语言模型(LLMs)背后的机制对于设计改进的模型和策略至关重要。尽管最近的研究对文本 LLMs 的机制产生了有价值的见解,但多模态大型语言模型(MLLMs)的机制仍未被充分探索。在本文中,我们应用机制可解释性方法来分析首个 MLLM——Llava 在视觉问答(VQA)中的机制。我们在颜色回答任务中比较了 VQA 和文本问答(TQA)的机制,并发现:a) VQA 表现出与 TQA 中观察到的上下文学习机制相似的机制;b) 在将视觉嵌入投影到嵌入空间时,视觉特征表现出显著的可解释性;c) Llava 在视觉指令微调期间增强了相应文本 LLM Vicuna 的现有能力。基于这些发现,我们开发了一种可解释性工具,以帮助用户和研究人员识别对最终预测重要的视觉位置,从而辅助理解视觉幻觉。与现有的可解释性方法相比,我们的方法展示了更快、更有效的结果。代码:\url{https://github.com/zepingyu0512/llava-mechanism}
引用
@article{arxiv.2411.10950,
title = {Understanding Multimodal LLMs: the Mechanistic Interpretability of Llava in Visual Question Answering},
author = {Zeping Yu and Sophia Ananiadou},
journal= {arXiv preprint arXiv:2411.10950},
year = {2025}
}
备注
preprint