Nüwa:修复视觉语言模型令牌剪枝破坏的空间完整性
计算机视觉与模式识别
2026-02-04 v1 人工智能
计算与语言
摘要
视觉令牌剪枝已被证明是加速高效视觉语言模型(VLM)的有效技术。然而,现有的剪枝方法在视觉问答(VQA)任务中表现出良好的性能保持,但在视觉定位(VG)任务上性能显著下降。我们对VLM处理流程的分析表明,利用全局语义相似性和注意力分数的策略会丢失全局空间参考框架,而该框架源自令牌位置信息的交互。受这些发现的启发,我们提出了Nüwa,一个两阶段令牌剪枝框架,能够在保持空间完整性的同时实现高效的特征聚合。在第一阶段,在视觉编码器之后,我们应用了三种操作,即分离、对齐和聚合,这些操作受群体智能算法启发,以保留信息丰富的全局空间锚点。在第二阶段,在LLM内部,我们执行文本引导的剪枝以保留与任务相关的视觉令牌。大量实验表明,Nüwa在多个VQA基准测试上达到了SOTA性能(从94%提升至95%),并在视觉定位任务上取得了显著改进(从7%提升至47%)。
引用
@article{arxiv.2602.02951,
title = {N\"uwa: Mending the Spatial Integrity Torn by VLM Token Pruning},
author = {Yihong Huang and Fei Ma and Yihua Shao and Jingcai Guo and Zitong Yu and Laizhong Cui and Qi Tian},
journal= {arXiv preprint arXiv:2602.02951},
year = {2026}
}