思维链压缩不应盲目:通过双路径锚定的V-Skip实现高效多模态推理
多媒体
2026-03-12 v4 计算与语言
计算机视觉与模式识别
摘要
虽然思维链(CoT)推理显著提升了多模态大语言模型(MLLM)的性能,但其自回归特性带来了难以承受的延迟约束。当前通过令牌压缩来缓解此问题的努力,往往因盲目地将以文本为中心的度量标准应用于多模态上下文而失败。我们识别出一种称为视觉遗忘的关键失败模式,即语言上冗余的令牌被错误地剪枝,导致幻觉。为解决此问题,我们引入了V-Skip,它将令牌剪枝重新表述为视觉锚定信息瓶颈(VA-IB)优化问题。V-Skip采用双路径门控机制,通过语言惊奇度和跨模态注意力流来权衡令牌重要性,从而有效拯救视觉显著的锚点。在Qwen2-VL和Llama-3.2系列上的大量实验表明,V-Skip实现了2.9倍的加速,且精度损失可忽略不计。具体而言,它保留了细粒度的视觉细节,在DocVQA上超过其他基线30%以上。
引用
@article{arxiv.2601.13879,
title = {Chain-of-Thought Compression Should Not Be Blind: V-Skip for Efficient Multimodal Reasoning via Dual-Path Anchoring},
author = {Dongxu Zhang and Yiding Sun and Cheng Tan and Wenbiao Yan and Ning Yang and Jihua Zhu and Haijun Zhang},
journal= {arXiv preprint arXiv:2601.13879},
year = {2026}
}