掩饰以看见:基于推理前缀掩码的视觉锚定思考在VLM蒸馏中的实现
计算机视觉与模式识别
2026-05-27 v4 人工智能
计算与语言
摘要
近期在视觉-语言模型(VLM)中采用的思考-回答方法(如Qwen3-VL-Thinking)通过在最终答案前利用中间思考步骤提升推理性能,但计算成本随模型规模显著增加。为将此类能力蒸馈到紧凑思考-回答型VLM,核心目标是提升学生在其思考轨迹中充分利用视觉证据的能力,因为长时间的思考-回答轨迹易出现视觉遗忘问题。为此,我们引入一种新型思考-回答蒸馈框架,通过掩码学生突出推理前缀来鼓励其在思考过程中以视觉信息为锚点。在掩码文本线索的纠正作用下,学生被鼓励在蒸馈期间更多依赖视觉证据作为信息来源。我们的掩码策略包括:1) 基于突出推理前缀的token级掩码,对每个下一个token预测有选择性地掩盖高影响力的推理前缀;2) 自节奏掩码预算调度,根据教师-学生分布间的差异逐步增加掩码规模。在蒸馈阶段,学生受我们突出推理前缀掩码的指引,该掩码屏蔽未来token与突出推理线索,替代自回归语言模型中使用的标准因果掩码。实验结果表明,我们的方法在多模态推理基准测试中超越了最新开源VLM、VLM蒸馈与自蒸馈方法,进一步分析确认了学生思考过程中视觉利用率的提升。
引用
@article{arxiv.2605.11651,
title = {Hide to See: Reasoning-prefix Masking for Visual-anchored Thinking in VLM Distillation},
author = {Seonghoon Yu and Dongjun Nam and Byung-Kwan Lee and Jeany Son},
journal= {arXiv preprint arXiv:2605.11651},
year = {2026}
}
备注
Pre-print