中文

VideoRouter:面向高效长视频理解的查询自适应双路由

计算机视觉与模式识别 2026-05-11 v2 人工智能

摘要

视频大型多模态模型正面临规模瓶颈:长视频产生过长的视觉token序列,在推理期间显著增加内存和延迟。虽然现有压缩方法在特定设置下效果良好,但大多数方法要么查询意识度弱,要么在帧上应用固定压缩策略,难以在视觉证据在时间上分布不均时达到最佳效果。为此,我们提出VideoRouter,一个基于InternVL构建的查询自适应双路由框架,用于预算化的证据分配。语义路由器预测主导分配策略,选择广泛的时间覆盖或自适应高分辨率保留之间的策略;图像路由器利用早期LLM层对帧相关性进行评分。这使得对不相关帧进行激进压缩,同时保留关键证据帧的细节。为训练两个路由器,我们构建Video-QTR-10K用于分配策略监督,Video-FLR-200K用于帧相关性监督。在VideoMME、MLVU和LongVideoBench上的实验表明,VideoRouter在可比或更低预算下, consistently 超过InternVL基线,实现了最高可达67.9%的token降低。

关键词

引用

@article{arxiv.2605.05848,
  title  = {VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding},
  author = {Kuanwei Lin and Wenhao Zhang and Ge Li},
  journal= {arXiv preprint arXiv:2605.05848},
  year   = {2026}
}