借助视觉-语义引导的松散推测解码:为视频大语言模型提供高效推理
计算与语言
2026-04-10 v2
摘要
视频大语言模型(Video-LLMs)在视频理解方面表现出色,但在自回归生成期间 suffer 高推理延迟。 speculative decoding(SD)通过应用草稿-验证范式来缓解这一问题,但现有方法受限于刚性的精确匹配规则,严重限制了加速潜力。为弥合这一差距,我们提出了LVSpec,这是首个为视频大语言模型量身定制的无训练松散SD框架。基于生成由稀疏视觉相关锚点(决定严格性)主导,以及丰富的视觉无关填充物(允许松散验证)构成的洞见,LVSpec采用轻量级的视觉相关token识别方案准确定位前者。为进一步最大化接受度,我们增强了一种对位置偏移具有容忍性的机制,以有效挽救位置不匹配但语义等效的token。实验表明,LVSpec在保持 >99.8% 目标性能的同时,将Qwen2.5-VL-32B加速2.70倍,将LLaVA-OneVision-72B加速2.94倍。值得注意的是,与面向视频大语言模型的SOTA无训练SD方法相比,LVSpec将平均被接受长度和加速比分别提高了136%和35%。
引用
@article{arxiv.2604.05650,
title = {See the Forest for the Trees: Loosely Speculative Decoding via Visual-Semantic Guidance for Efficient Inference of Video LLMs},
author = {Yicheng Ji and Jun Zhang and Jinpeng Chen and Cong Wang and Lidan Shou and Gang Chen and Huan Li},
journal= {arXiv preprint arXiv:2604.05650},
year = {2026}
}
备注
ACL'2026 Main Conference