中文

LatentRouter:我们能在看到答案前选择正确的多模态模型吗?

人工智能 2026-05-13 v1 计算与语言 计算机视觉与模式识别

摘要

多模态大语言模型(MLLMs)在 OCR、图表理解、空间推理、视觉问答、成本和延迟等方面具有异构的优势。有效的 MLLM 路由不仅需要估计查询难度,还需要将当前图像-问题输入的多模态要求与每个候选模型的能力相匹配。我们提出 LatentRouter,这是一个将 MLLM 路由形式化为反事实多模态效用预测的路由器。给定图像-问题查询,LatentRouter 提取学习到的多模态路由胶囊,代表每个候选 MLLM 的模型能力标记,并在这些状态之间进行潜在通信,以估计每种模型若被选中将如何表现。一个分布式结果头预测模型特定的反事实质量,同时一个受限的胶囊校正在近似决策之间进行细化,而不允许残差信号主导预测。 resulting 的基于效用的策略支持面向性能的路由和性能-成本路由,并能通过共享的 per-model 评分和可用性掩码处理变化的候选池。在 MMR-Bench 和 VL-RouterBench 上的实验表明,LatentRouter 在固定模型、特征级和学习路由基线上均表现优于。额外分析表明,收益在视觉、布局敏感或推理导向要求的多模态任务组中最为显著,而潜在通信是改进的主要贡献者。代码可在 https://github.com/LabRAI/LatentRouter 查阅。

关键词

引用

@article{arxiv.2605.11301,
  title  = {LatentRouter: Can We Choose the Right Multimodal Model Before Seeing Its Answer?},
  author = {Xueqi Cheng and Yushun Dong},
  journal= {arXiv preprint arXiv:2605.11301},
  year   = {2026}
}