VL-RouterBench:面向视觉语言模型路由的基准测试
机器学习
2026-03-19 v2 人工智能
计算与语言
摘要
多模型路由已从工程技术发展为essential infrastructure,但现有工作缺乏系统可重复的基准测试以评估视觉语言模型(VLM)。我们提出 VL-RouterBench 来系统评估 VLM 路由系统的整体能力。该基准测试基于 VLM 的原始推理和评分日志构建质量和成本矩阵,覆盖样本-模型对。在规模方面,VL-RouterBench 覆盖 14 个数据集的 30,540 个样本,包括 15 个开源模型和 2 个 API 模型,形成 519,180 个样本-模型对,总输入输出 token 数量为 34,494,977。评估协议联合测量平均准确率、平均成本和吞吐量,并以归一化成本和准确率的调和平均数构建排名得分,以实现跨路由配置和成本预算的比较。在此基准测试上,我们评估了 10 种路由方法和基线方法,观察到显著的 routability 提升,但最佳当前路由器仍与理想 Oracle 之间存在明显差距,表明在更细致的视觉线索和文本结构建模方面仍有很大的改进空间。我们将开源完整的数据构建和评估工具链,以促进多模态路由研究中的可比性、可重复性和实际部署。
引用
@article{arxiv.2512.23562,
title = {VL-RouterBench: A Benchmark for Vision-Language Model Routing},
author = {Zhehao Huang and Baijiong Lin and Jingyuan Zhang and Jingying Wang and Yuhang Liu and Ning Lu and Tao Li and Xiaolin Huang},
journal= {arXiv preprint arXiv:2512.23562},
year = {2026}
}
备注
CVPR 2026 Accepted