看到但不思考:多模态混合专家的路由分心现象
计算机视觉与模式识别
2026-04-10 v1 人工智能
计算与语言
摘要
多模态混合专家 (MoE) 模型在视觉-语言任务上取得了显著的性能。然而,我们发现了一个被称为看到但不思考的颠覆性现象:模型准确感知图像内容,却在后续推理中失败,而在纯文本形式呈现的相同问题上却能正确解决。通过系统性分析,我们首先验证了 MoE 架构中存在跨模态语义共享,排除了仅由语义对齐失败导致的解释。我们进一步揭示,视觉专家与领域专家在层级上呈现分离,图像输入在领域专家集中区域的中间层中引起了显著的路由偏差。基于这些发现,我们提出了路由分心假说:在处理视觉输入时,路由机制未能充分激活与任务相关的推理专家。为验证此假说,我们设计了一种受路由引导的干预方法,以增强领域专家的激活。在三个多模态 MoE 模型上进行六个基准测试的实验表明,实施了一致的改进,在复杂视觉推理任务上提升幅度可达 3.17%。我们的分析进一步揭示,领域专家识别定位于认知功能而非特定样本解决方案,从而实现跨不同信息结构的任务间有效迁移。
引用
@article{arxiv.2604.08541,
title = {Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts},
author = {Haolei Xu and Haiwen Hong and Hongxing Li and Rui Zhou and Yang Zhang and Longtao Huang and Hui Xue and Yongliang Shen and Weiming Lu and Yueting Zhuang},
journal= {arXiv preprint arXiv:2604.08541},
year = {2026}
}