语言的代价:质心擦除揭示并利用多模态语言模型中的模态竞争
计算与语言
2026-04-17 v1 人工智能
计算机视觉与模式识别
摘要
多模态语言模型在视觉感知任务上系统性表现不佳,但支撑这种失败的结构仍未被充分理解。我们提出质心替换,即将每个token坍缩到其最近的K-means质心,作为模态依赖性的受控探针。跨越三个架构家族的七个模型,擦除文本质心结构造成的准确率损失是擦除视觉质心结构的4倍,揭示了一种普遍的不平衡,即语言表征即使在需要视觉推理的任务上也凌驾于视觉之上。我们利用这种不对称性,通过文本质心对比解码,在单个任务上恢复了高达+16.9%的准确率,方法是针对文本质心擦除的参考进行对比解码。这种干预随训练方法显著变化:标准微调模型显示出比偏好优化模型更大的增益(平均+5.6%对比+1.5%)。我们的发现表明,模态竞争在结构上是局部的,可以在推理时无需重新训练即可纠正,并且可以作为指导未来多模态训练的量化诊断信号。
引用
@article{arxiv.2604.14363,
title = {The Cost of Language: Centroid Erasure Exposes and Exploits Modal Competition in Multimodal Language Models},
author = {Akshay Paruchuri and Ishan Chatterjee and Henry Fuchs and Ehsan Adeli and Piotr Didyk},
journal= {arXiv preprint arXiv:2604.14363},
year = {2026}
}
备注
29 pages, 9 figures, 19 tables