面向大规模视觉语言模型的视频令牌降采样:结合相似性与重要性的FrameFusion方法
计算机视觉与模式识别
2025-01-07 v1 人工智能
摘要
处理长时段高分辨率视频的需求显著增加,给大规模视觉语言模型(LVLMs)带来了巨大的视觉令牌数量的负担。现有令牌降采样方法主要基于重要性指标(如累计注意力得分)进行令牌修剪。然而,即使是重要的令牌也可能因相邻视频帧之间的相似性以及重复的视觉元素而产生高冗余。为解决此限制,我们提出了FrameFusion,这是一种集成相似性基于合并与重要性基于修剪的新型令牌降采样方法。我们对令牌相似性特征进行了彻底研究,发现三个关键见解:(1)相邻帧之间空间对应的视觉令牌的余弦相似性高于其他令牌对;(2)高令牌相似性在更深的模型层中显著降低;(3)令牌相似性排名在不同层之间高度一致。基于这些观察,FrameFusion仅计算相邻帧之间空间对应的视觉令牌的相似性,在初始连续层应用令牌合并,然后在更深的层中进行修剪,并采用级联合并策略进一步提升效率。我们在六个 diverse LVLMs(参数规模从2B至72B)上全面评估了FrameFusion,使用包括视频检索、问答和时空理解任务在内的五个视频基准测试。实验表明,FrameFusion将视觉令牌减少70%,实现端到端加速1.6-3.6倍,平均性能影响小于3%。我们的代码可在 https://github.com/thu-nics/FrameFusion 获取。
关键词
引用
@article{arxiv.2501.01985,
title = {Fall Detection in Passenger Elevators using Intelligent Surveillance Camera Systems: An Application with YoloV8 Nano Model},
author = {Pinar Yozgatli and Yavuz Acar and Mehmet Tulumen and Selman Minga and Salih Selamet and Beytullah Nalbant and Mustafa Talha Toru and Berna Koca and Tevfik Keles and Mehmet Selcok},
journal= {arXiv preprint arXiv:2501.01985},
year = {2025}
}
备注
8 pages, 3 figures