基于加速分词和边缘增强推理的 QuickGrasp:响应式视频-语言查询服务
计算机视觉与模式识别
2026-03-03 v1 人工智能
信息检索
多媒体
性能
系统与控制
系统与控制
摘要
视频语言模型(VLMs)正在重塑视频查询服务,为复杂感知和推理任务提供统一解决方案。然而,由于资源需求高,实际部署大型 VLMs 仍具挑战性,远程部署往往导致不可接受的响应延迟。虽然小型本地可部署 VLMs 能提供快速响应,但不可避免地在准确性方面不足。为解决这一权衡问题,我们提出 QuickGrasp,一个面向服务质量(QoS)的响应式系统,通过本地优先架构和按需边缘增强实现平衡。基于 VLMs 的高度模块化架构,QuickGrasp 在不同模型变体之间共享视觉表征,以避免冗余计算。为最大化系统整体效率,QuickGrasp 引入三项关键设计:加速视频分词、查询自适应边缘增强以及延迟感知、保准确率的视觉 token 稀疏度配置。我们实现了 QuickGrasp 的原型,并在多个视频理解基准上进行评估。结果表明,QuickGrasp 在准确性上与大型 VLMs 相当,同时实现了最高 12.8 倍的响应延迟降低。QuickGrasp 代表了构建面向开放世界理解的响应式视频查询服务的关键进步,充分发挥 VLMs 的能力。
引用
@article{arxiv.2603.00126,
title = {QuickGrasp: Responsive Video-Language Querying Service via Accelerated Tokenization and Edge-Augmented Inference},
author = {Miao Zhang and Ruixiao Zhang and Jianxin Shi and Hengzhi Wang and Hao Fang and Jiangchuan Liu},
journal= {arXiv preprint arXiv:2603.00126},
year = {2026}
}