中文

从注意力头到神经元:多任务视觉-语言模型中的因果归因与引导

计算机视觉与模式识别 2026-04-21 v1 计算与语言

摘要

近期工作越来越多地探索视觉-语言模型(VLM)中的神经元级解释,以识别对最终预测至关重要的神经元。然而,现有的神经元分析通常聚焦于单一任务,限制了神经元重要性在任务间的可比性。此外,排序策略倾向于孤立地对神经元评分,忽略了任务相关的信息通路如何塑造前馈网络(FFN)神经元的写入效应。这种疏忽可能加剧多任务设置中的神经元多义性,给任务关键神经元的识别和干预引入噪声。在本研究中,我们提出HONES(面向注意力头的神经元解释与引导),一个用于多任务VLM中任务感知神经元归因和引导的无梯度框架。HONES根据任务相关的注意力头所调节的因果写入贡献对FFN神经元进行排序,并通过轻量级缩放进一步调节显著神经元。在四个不同的多模态任务和两个流行的VLM上的实验表明,HONES在识别任务关键神经元方面优于现有方法,并在引导后提升了模型性能。我们的源代码发布在:https://github.com/petergit1/HONES。

关键词

引用

@article{arxiv.2604.17941,
  title  = {From Heads to Neurons: Causal Attribution and Steering in Multi-Task Vision-Language Models},
  author = {Qidong Wang and Junjie Hu and Ming Jiang},
  journal= {arXiv preprint arXiv:2604.17941},
  year   = {2026}
}

备注

ACL 2026 Findings