中文

DynaTok:面向视频大语言模型的时间自适应与位置偏差感知的标记压缩

计算机视觉与模式识别 2026-05-20 v1

摘要

近期视频大语言模型(Video-LLMs)的快速发展极大扩展了多模态推理能力。然而,从长视频序列中提取的大量视觉标记带来了巨大的计算成本,限制了其在实际场景中的部署。现有训练无关的标记压缩方法仅依据注意力幅度作为语义重要性的代理指标,却常常忽视位置偏差且仅依赖短期时间局部性,导致时空覆盖冗余且标记使用效率低下。我们提出的DynaTok是一个训练无关、时序自适应且偏差感知的标记压缩框架,跨越时间维度和空间维度分配标记预算。通过轻量级的指数移动平均(EMA)记忆,时间预算分配(TBA)模块动态地对冗余帧分配较少的标记,对新颖帧分配较多的标记,从而捕捉长期时序变化。空间预算分配(SBA)模块通过基于激活的注意力图选取时空上具有代表性且语义重要的特征,同时利用空间记忆减少先前选中区域的冗余性并缓解位置偏差。DynaTok可无缝集成到现有的Video-LLMs中,如LLaVA-OneVision和LLaVA-Video,无需重新训练,能够在激进压缩下有效保持语义覆盖。在四个代表性VideoQA基准测试(MVBench、LongVideoBench、MLVU和VideoMME)上的实验表明,DynaTok即使在压缩90%的标记下,也能保留超过95%的基线准确率,超越了近期的训练无关方法。这些结果表明,DynaTok为高效且稳健的视频推理提供了原则性的基础,为未来的Video-LLMs实现实时流式视频理解指明了道路。

关键词

引用

@article{arxiv.2605.19322,
  title  = {DynaTok: Temporally Adaptive and Positional Bias-Aware Token Compression for Video-LLMs},
  author = {Minyoung Park and Taehun Kong and Sangjun Ahn},
  journal= {arXiv preprint arXiv:2605.19322},
  year   = {2026}
}