中文

通过帧Mogging实现视频视觉语言模型的极限提升:无需训练的反重计算

计算机视觉与模式识别 2026-05-06 v1 人工智能

摘要

视频视觉语言模型(VLMs)持续为视觉状态支付费用,尽管已被证明是稳定的。工厂墙壁并未移动,但大多数 VLM 流程仍对模型提供密集的 RGB 帧或新的前缀。我们研究了这种浪费,作为无需训练的反重计算:在验证表明状态可靠的前提下复用状态,当场景、查询或缓存拓扑需要时,再获取新证据。最大的measured收益发生在摄入后。对于冻结的 Qwen2.5-VL-7B-Instruct-4bit 模型,自适应的同视频后续复用在 93 查询的 VideoMME 广度设置下保持了配对选择和正确性,同时将后续延迟降低了 14.90-35.92 倍。首次查询仍为冷启动;收益是在后续问题复用相同视频状态后才会显现。压力测试限制了结果:重复问题计划在 50 轮内保持有效,而密集答案锚定的提示变化区分了保守的固定 K=1 修复和更快的激进策略后者会产生漂移。新视频剪枝虽小但真实。C-VISION 在第一个答案生成前跳过计时的视觉塔工作。在 Gemma 4-E4B-4bit 上,干净的 32f 短单元实现了 1.316 倍的首查询加速,未出现配对漂移或解析错误,20 项测试中表现良好;Qwen 显示了保真度/速度的边界。阶段共享上限(C-CEILING)是会计警戒线:组件加速只有在加速其占比的墙钟时间比例下,才会成为端到端加速,因此 C-VISION 和摄入后复用不具备乘法效应。候选 C-STREAM 仍是本节中非头条结果的本机率目标。更广泛的方向是 VLM 原生媒体,直接暴露变化、运动、不确定性、物体状态、传感器时间和活动瓷砖,以便模型无需每帧从密集 RGB 中重新发现世界。

关键词

引用

@article{arxiv.2605.03351,
  title  = {VLMaxxing through FrameMogging Training-Free Anti-Recomputation for Video Vision-Language Models},
  author = {JF Bastien and Sam D'Amico},
  journal= {arXiv preprint arXiv:2605.03351},
  year   = {2026}
}

备注

37 pages, 6 figures, 22 tables; code and artifacts available at https://github.com/jfbastien/VLMaxxing