面向高效视觉语言模型的端到端序列紧凑化——CIVIC
人工智能
2026-05-28 v1
摘要
视觉语言模型 (VLM) 因高分辨率视觉标记而面临严重的内存和延迟瓶颈。虽然当前的标记降采样方法在理论上可节省 FLOPs,但事后修剪引入结构性开销,未能实现比例的实际 wall-clock 加速。然而,强制连续紧凑路径风险在几何定位上出现错位并丧失细粒度定位能力。为克服此障碍,本文提出 CIVIC——一种路径一致的紧凑视觉推理框架。通过在视觉编码器、投影层、LLM 预填充及 KV-cache 之间保持紧凑序列表示的无缝衔接,CIVIC 避免非连续内存访问和局部解聚开销。评估于 Qwen3-VL 架构时,CIVIC 成功将序列降采样转化为真实的硬件效率,KV-cache 内存约减至基准的三分之一,端到端推理延迟显著降低。得益于文本对齐 KL 蒸馏和自适应空间保留底线,CIVIC 在不损害准确性的前提下,通过严格的多模态推理和视觉定位基准实现了这些效率里程碑。
关键词
引用
@article{arxiv.2605.28115,
title = {CIVIC: End-to-End Sequence Compactness for Efficient Vision-Language Models},
author = {Fengze Yang and Bo Yu and Xuewen Luo and Cathy Liu and Chenxi Liu},
journal= {arXiv preprint arXiv:2605.28115},
year = {2026}
}
备注
11 pages, 6 figures, 2 tables, conference