中文

探索大型视觉语言模型中知识演化的机制

计算机视觉与模式识别 2025-04-08 v2 机器学习

摘要

大型视觉语言模型(LVLMs)正逐渐成为许多人工智能应用的基础。然而,理解其内部工作机制持续困扰着研究者,这反过来限制了其能力的进一步提升。本文旨在调查多模态知识如何演化并最终诱导出自然语言表述。我们设计了一系列新颖的策略,用于分析 LVLMs 内部的知识。我们深入探讨了从三个层面上对多模态知识的演化,包括单个 token 概率、token 概率分布以及特征编码。在此过程中,我们识别出知识演化中的两个关键节点:临界层和突变层,将演化过程划分为三个阶段:快速演化、稳定化和突变。我们的研究首次揭示了 LVLMs 中知识演化的轨迹,为理解其底层机制提供了全新的视角。我们的代码已公开于 https://github.com/XIAO4579/Vlm-interpretability。

关键词

引用

@article{arxiv.2504.02862,
  title  = {Towards Understanding How Knowledge Evolves in Large Vision-Language Models},
  author = {Sudong Wang and Yunjian Zhang and Yao Zhu and Jianing Li and Zizhe Wang and Yanwei Liu and Xiangyang Ji},
  journal= {arXiv preprint arXiv:2504.02862},
  year   = {2025}
}

备注

Accepted by CVPR 2025