中文

Transcoders 揭示视觉 grounding 与幻觉现象

机器学习 2026-05-25 v1 人工智能 计算与语言

摘要

生成式视觉语言模型 (VLM) 在多模态推理方面表现良好,但视觉输入如何转化为文本仍鲜有了解。现有 VLM 可解释性工作使用稀疏自编码器 (SAE),其分解静态残差表示,遗漏了驱动跨模态交互的功能性更新。我们采用基于Transcoders的函数中心框架,Transcoders是 MLP 子层的稀疏近似,作为层级计算的因果代理。应用于Gemma 3-4B-IT,该框架将模型分解为可解释的计算路径,链接图像块到标记生成中的方向。Transcoder归因在块擦除下对视觉锚定标记的影响比SAE归因更强且更稳定,还能更好地与语义相关的图像区域对齐。一个虚假视觉锚定反事实分析确认,恢复的路径专为视觉-语言交互而设计。最后,我们通过提取Transcoders产生的电路痕迹中的图基指标,对幻觉生成进行结构分析。基于这些机制图特征的逻辑分类器以AUC 0.680.68 预测幻觉生成。这些结果表明,函数中心的电路分解可为 VLM 中的多模态计算提供可解释且可预测的account。

关键词

引用

@article{arxiv.2605.22902,
  title  = {Transcoders Trace Visual Grounding and Hallucinations in Vision-Language Models},
  author = {Dimitrios Damianos and Leon Voukoutis and Georgios Skyrianos and Vassilis Katsouros and Georgios Paraskevopoulos},
  journal= {arXiv preprint arXiv:2605.22902},
  year   = {2026}
}