Fre-Res: 面向高效视频MLLM的频率残差视频令牌压缩
计算机视觉与模式识别
2026-05-19 v1 人工智能
摘要
视频多模态大语言模型(MLLM)面临着空间保真度与时间覆盖之间的持续张力:保留细粒度视觉细节需要大量空间令牌,而捕获短暂事件则需要密集的时间采样。我们提出了Fre-Res,一个预算自适应的双轨视频令牌压缩框架,它将这两种形式的证据分离开来。Fre-Res保留稀疏的高保真空间锚点,并通过紧凑的残差频率令牌表示密集的时间演化。具体来说,它在视觉潜在空间中对帧间残差轨迹应用时间一维离散余弦变换(1D-DCT),我们观察到其中存在强烈的低频集中现象。为了将频域动态与原生视觉嵌入对齐,Fre-Res引入了一个空间引导吸收器,将时间残差信息注入到空间对应的锚点令牌中。在细粒度短视频和长视频推理基准测试中,Fre-Res实现了有利的精度-效率权衡,匹配或接近全令牌性能,同时大幅减少了视觉令牌长度。广泛的消融实验进一步表明,时间频率残差保留了因果转换线索,而空间锚点对于细粒度对象和布局推理仍然至关重要。
引用
@article{arxiv.2605.16366,
title = {Fre-Res: Frequency-Residual Video Token Compression for Efficient Video MLLMs},
author = {Yigui Feng and Qinglin Wang and Yang Liu and Jie Liu},
journal= {arXiv preprint arXiv:2605.16366},
year = {2026}
}
备注
24 pages, 5 figures