大型多模态模型能解释大型多模态模型中的特征
计算机视觉与模式识别
2025-09-19 v2 计算与语言
摘要
近期在大型多模态模型(LMM)方面的进展在学术界和工业界均取得了显著突破。一个值得关注的问题是:我们作为人类如何理解其内部神经表征。本文采取初始步骤,提出一种通用框架来识别和解释 LMM 中的语义。具体而言,我们首先将稀疏自编码器(SAE)应用于分离表示为人类可理解特征。随后,我们提出一种自动解释框架,用 LMM 本身解释 SAE 中学习的开放语义特征。我们采用该框架分析 LLaVA-NeXT-8B 模型,利用 LLaVA-OV-72B 模型进行分析,证明这些特征能够有效引导模型行为。我们的结果有助于更深入地理解 LMM 在特定任务(包括情感测试)中的卓越表现,阐明其错误本质及潜在纠正策略。这些发现为我们提供了对 LMM 内部机制的新见解,并提示其与人类大脑认知过程之间的相似性。
引用
@article{arxiv.2411.14982,
title = {Large Multi-modal Models Can Interpret Features in Large Multi-modal Models},
author = {Kaichen Zhang and Yifei Shen and Bo Li and Ziwei Liu},
journal= {arXiv preprint arXiv:2411.14982},
year = {2025}
}