从像素与文字到波:谱字典 vLLM 的统一框架
计算机视觉与模式识别
2025-06-25 v1
摘要
视觉语言模型 (VLM) 将计算机视觉和自然语言处理统一于单一架构中,能够解释和描述图像。目前领先的系统依赖两个计算密集型组件:视觉编码器中的卷积和多模态融合中的二次自注意力。本工作通过引入谱字典 token 混合器,消除两者,图像块或词片段被表示为可学习频率原子的稀疏组合。我们的 11 亿参数原型系统 SDict-VLM 在 MS-COCO 图像字幕任务上实现了 BLEU-4 为 39.2、CIDEr 为 127.5、SPICE 为 27.0,同时在 VQAv2 上达到 50.3% 的准确率。这些结果在参数数量减少约 60%、峰值 GPU 内存减少 2.3 倍、推理速度提升 2.2 倍的情况下,将约 85% 的性能差距缩小至 BLIP-2。据我们所知,这是首个在消除卷积和自注意力后仍能匹配中等规模 transformer 基线的 VLM。除了 O(L log L) 的复杂度,该共享频率字典实现了透明的跨模态对齐,并提供了在准确率与计算量之间可调的权衡,为高效可解释的 VLM 铺平了道路。
引用
@article{arxiv.2506.18943,
title = {From Pixels and Words to Waves: A Unified Framework for Spectral Dictionary vLLMs},
author = {Andrew Kiruluta and Priscilla Burity},
journal= {arXiv preprint arXiv:2506.18943},
year = {2025}
}