中文

超越下一个标记对齐:基于标记相互作用的多模态大语言模型蒸馏

计算机视觉与模式识别 2026-02-11 v1

摘要

多模态大语言模型 (MLLM) 展示了惊人的跨模态能力,但其庞大规模导致部署遇到诸多挑战。知识蒸馏 (KD) 是一种有前景的压缩方案,但现有方法主要依赖静态的下一个标记对齐,忽略了标记间动态相互作用——这些相互作用嵌入了多模态理解与生成的关键能力。为此,我们提出了一种基于标记相互作用 (Token Interactions) 的新型 KD 框架 Align-TI。我们洞察到 MLLM 依赖两种主要相互作用:视觉指令标记相互作用用于提取相关视觉信息,以及响应内标记相互作用用于生成连贯的输出。Align-TI 包含两个组件:IVA 通过在显著视觉区域上对齐,使学生模型模仿教师模型的指令相关视觉信息提取能力;TPA 通过对齐序列化标记间的转移概率,捕获教师模型的动态生成逻辑。大量实验表明,Align-TI 的优势显而易见。显著的是,我们的方法相较于 Vanilla KD 取得了 2.6% 的相对提升,而我们的蒸馏版 Align-TI-2B 甚至超过了 LLaVA-1.5-7B (一个规模更大的 MLLM) 的 7.0%,建立了训练参数高效 MLLM 的新型最先进蒸馏框架。代码已公开于 https://github.com/lchen1019/Align-TI。

关键词

引用

@article{arxiv.2602.09483,
  title  = {Beyond Next-Token Alignment: Distilling Multimodal Large Language Models via Token Interactions},
  author = {Lin Chen and Xiaoke Zhao and Kun Ding and Weiwei Feng and Changtao Miao and Zili Wang and Wenxuan Guo and Ying Wang and Kaiyuan Zheng and Bo Zhang and Zhe Li and Shiming Xiang},
  journal= {arXiv preprint arXiv:2602.09483},
  year   = {2026}
}