中文

通用提升,特定抑制:稀疏自编码器引导的医学视觉语言模型

计算机视觉与模式识别 2026-05-26 v1 计算与语言

摘要

医学视觉语言模型(VLMs)在生成胸X线报告时常会出现幻觉现象:它们会生成图像中不存在的发现,遗漏重要发现,或定位错误。我们通过解码时稀疏自编码器(SAE)基上的残差引导来缓解此问题,无需进行权重更新:对后期层的Top-K SAEs进行因果引导,以纠正临床错误,然后在推理时组合抑制/提升干预。在MIMIC-CXR测试集上,我们的方法在三个放射学VLMs(RadVLM、LLaVA-Rad和CheXOne)的生成报告质量上分别实现了+5.4%、+7.2%和+17.0%的临床复合指标提升,并在所有主干模型上实现统计显著的GREEN增益。跨模型特征对齐显示,质量提升(boost)方向在不同架构之间高度重叠,而与幻觉相关的抑制(suppress)方向则具有模型特定性。因此,传输式引导必须针对每个主干模型进行抑制处理,而不能共享通用抑制列表。该配方在无 retraining的情况下零样本迁移到IU-XRay(Green提升+7.7%),确认了所识别特征是模型属性,而非训练语料库的属性。我们发布了因果特征集和交互式特征仪表盘:https://cxr-sparse-feature-dashboard.netlify.app/。

关键词

引用

@article{arxiv.2605.24977,
  title  = {Universal Boosts, Specific Suppressors: Sparse Autoencoder Steering of Medical Vision-Language Models},
  author = {Farhad Nooralahzadeh and Benjamin Gundersen and Nicolas Deperrois and Hidetoshi Matsuom and Mizuho Nishio and Thomas Frauenfelder and Ahmed Allam and Christian Blüthgen and Michael Moor and Michael Krauthammer},
  journal= {arXiv preprint arXiv:2605.24977},
  year   = {2026}
}