最小化神经元消融触发大型视觉语言模型语言核心的灾难性崩溃
人工智能
2025-12-02 v1
摘要
大型视觉语言模型 (LVLMs) 在多模态理解能力方面表现突出,但其鲁棒性仍不被充分理解。本文我们调查LVLMs对结构性脆弱性,以识别哪些关键神经元的移除会触发灾难性崩溃。在此语境下,我们提出了CAN方法,用于检测一致激活神经元并定位关键神经元。实验在LLaVA-1.5-7b-hf和InstructBLIP-Vicuna-7b上揭示,仅掩盖语言模型中少量前馈网络神经元(在极端情况下仅四个神经元)即可触发灾难性崩溃。值得注意的是,关键神经元主要局限于语言模型而非视觉组件中,下投影层是一个尤其脆弱的结构。我们还观察到一种持续的两阶段崩溃模式:初始表达退化随后是突发的、完全的崩溃。我们的发现为LVLMs的安全研究提供了重要见解。
引用
@article{arxiv.2512.00918,
title = {Minimal neuron ablation triggers catastrophic collapse in the language core of Large Vision-Language Models},
author = {Cen Lu and Yung-Chen Tang and Andrea Cavallaro},
journal= {arXiv preprint arXiv:2512.00918},
year = {2025}
}
备注
15 pages, 6 figures,