Espresso:面向视觉语言模型的高压缩率视频提取
计算机视觉与模式识别
2025-05-19 v3
摘要
近期视觉语言模型(VLM)在图像和文本连接方面取得了显著进展,但将这些模型扩展到长视频仍面临令牌数量快速增长的挑战。通过时间或空间局部聚合进行视频压缩的模型因处理长时段输入而受到青睞;然而,这类基于池化的投�器牺牲了固定长度表示的优势,这对于流式和高效视频理解至关重要。我们提出一种新型架构 ,独立压缩空间和时间特征到固定长度序列。 在保持强大的长程推理能力的同时,实现了高效的视频编码。实验表明,固定长度压缩结合分段处理为基于池化的方法提供了可扩展且具竞争力的替代方案。我们的结果表明,经过恰当设计和训练的固定长度投�器仍是视频语言建模的可行基础。
引用
@article{arxiv.2412.04729,
title = {Espresso: High Compression For Rich Extraction From Videos for Your Vision-Language Model},
author = {Keunwoo Peter Yu and Achal Dave and Rares Ambrus and Jean Mercat},
journal= {arXiv preprint arXiv:2412.04729},
year = {2025}
}
备注
16 pages