面向视觉语言模型的情景感知路由
机器学习
2025-11-03 v1 人机交互
摘要
视觉语言模型(VLM)在 diverse multimodal tasks 中表现出色。然而,用户在不同情景下的需求各不相同,可归类为快速响应、高质量输出和低能耗消耗。仅依赖部署在云端的大型模型处理所有查询往往导致高延迟和高能耗,而部署在边缘设备上的小型模型能够以低延迟和低能耗处理简单任务。为充分发挥大型模型和小型模型各自优势,我们提出 ECVL-ROUTER,即第一个面向 VLM 的情景感知路由框架。我们的方案引入新的路由策略和评估指标,根据用户需求动态选择合适的模型,从而最大化整体效用。我们还构建了一个针对路由训练的多模态响应质量数据集,并通过大量实验验证了该方法的有效性。结果表明,该方案成功将超过 80% 的查询路由到小型模型,同时在问题解决概率下降不到 10%。
引用
@article{arxiv.2510.27256,
title = {ECVL-ROUTER: Scenario-Aware Routing for Vision-Language Models},
author = {Xin Tang and Youfang Han and Fangfei Gou and Wei Zhao and Xin Meng and Yang Yu and Jinguo Zhang and Yuanchun Shi and Yuntao Wang and Tengxiang Zhang},
journal= {arXiv preprint arXiv:2510.27256},
year = {2025}
}
备注
23 pages, 13 figures, 7 tables