中文

HEED:基于密度加权残差对齐的混合视觉语言模型蒸馏

计算机视觉与模式识别 2026-05-19 v1 计算与语言

摘要

将视觉语言模型蒸馏到更快的混合架构(如 3:1 的 Mamba-2/注意力混合)是提高推理效率的标准做法。但聚合基准测试表明该方法有效,却隐藏了选择性失效。当我们将 Qwen3-VL-8B-Instruct 蒸馏到 3:1 Mamba-2/注意力混合模型时,学生模型在视觉推理基准(如 MMStar、MMBench 和 MMMU-Pro)中保持与教师模型在 2 分钟以内,但在光学字符识别和文档任务中下降 13 分钟。在高分辨率图像中,大多数 patch 为天空、墙壁或光滑纹理,而少数 carry 文本、边缘、物体边界或其他局部细节。在 token 级别诊断中,最高密度的前 10% patch 的残差漂移比最低密度的后 10% patch 大 3.6 倍,教师掩码答案贡献大 3.5 倍。均匀加权会将许多损失项用于低信息背景 patch,而稀疏的答案承载 patch 获得不到特别保护。所需干预最小:我们将均匀残差对齐替换为密度加权残差对齐,采用 patch 自 dissimilarity 作为位置重要性的训练-free 代理。我们称之为 HEED。与常规端到端蒸馏相比,HEED 在 OCRBench v2 上提升 8.7 分钟,在 10 个基准平均值上提升 5.13 分钟。该提升在不同教师模型和混合架构上均可实现。经过标准后训练,学生模型在 10 个基准平均值上达到教师水平性能,同时实现 4.12 倍吞吐量和 68% 内存节省,上下文长度为 128k,无需额外参数且无需推理时开销。

关键词

引用

@article{arxiv.2605.17093,
  title  = {HEED: Density-Weighted Residual Alignment for Hybrid Vision-Language Model Distillation},
  author = {Yihao Liang and Niraj K. Jha},
  journal= {arXiv preprint arXiv:2605.17093},
  year   = {2026}
}