中文

Fourier Compressor:面向视觉语言模型的频域视觉 Token 压缩

计算机视觉与模式识别 2026-05-19 v3 人工智能

摘要

视觉语言模型(Vision-Language Models, VLMs)因高分辨率图像和视频输入引入的大量视觉 token 而产生巨大的计算开销和推理延迟。现有的无参数 token 压缩方法通常依赖于 token 选择或合并,但这可能会丢失大量视觉信息或扭曲原始表示分布,导致在高压缩率下性能显著下降。为此,我们旨在探索一种更有效、更高效的视觉 token 压缩策略,频域是一个极具前景的方向。受频域变换在图像压缩(例如 JPEG)中取得成功的启发,我们系统地分析了视觉表示中的频域冗余,并揭示了语义信息在频带间的不均匀分布。在此基础上,我们引入了 Fourier Compressor,这是一个有效、无参数且具有高度泛化能力的模块,可在频域内消除视觉表示中的冗余。Fourier Compressor 通过复杂度为 O(n2logn)\mathcal{O}(n^2 \log n) 且无额外参数的 FFT 实现,在保持语义保真度的同时引入了可忽略不计的计算开销。在基于图像的基准上的大量实验表明,我们的方法实现了良好的性能与效率折衷,在将推理 FLOPs 最多减少 83.8% 并将生成速度提升 31.2% 的同时,保留了超过 96% 的原始准确率。它始终优于现有的无参数方法,甚至超越了一些有参数方法。重要的是,Fourier Compressor 在 LLaVA 和 Qwen-VL 架构上均表现出一致的泛化能力,并进一步扩展到视频理解任务,突显了其在高效 VLMs 中的实用价值。

关键词

引用

@article{arxiv.2508.06038,
  title  = {Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models},
  author = {Huanyu Wang and Jushi Kai and Haoli Bai and Lu Hou and Bo Jiang and Ziwei He and Zhouhan Lin},
  journal= {arXiv preprint arXiv:2508.06038},
  year   = {2026}
}