中文

LinguDistill:通过选择性跨模态蒸馏恢复视觉语言模型中的语言能力

计算机视觉与模式识别 2026-04-28 v3 计算与语言

摘要

将预训练语言模型(LMs)适配为视觉语言模型(VLMs)时,由于多模态适配过程中引入的表示偏移和跨模态干扰,其原生语言能力可能会退化。即使使用标准目标函数进行针对性的任务特定微调,也难以恢复此类损失。先前的恢复方法通常引入额外模块作为中间对齐层来维持或隔离模态特定子空间,这会增加架构复杂度,在推理时引入参数,并限制模型和设置之间的灵活性。我们提出 LinguDistill,一种无适配器的蒸馏方法,通过利用原始冻结语言模型作为教师来恢复语言能力。我们通过引入逐层 KV 缓存共享来克服使教师获得视觉条件监督的关键挑战,从而使教师在不修改任何模型架构的情况下接触到学生的多模态表示。随后,我们选择性地蒸馏教师在语言密集数据上的强语言信号以恢复语言能力,同时保留学生在多模态任务上的视觉基础。因此,LinguDistill 在语言和知识基准上恢复了约 10% 的性能损失,同时在视觉密集型任务上保持可比的性能。我们的结果表明,语言能力可以在不引入额外模块的情况下恢复,为多模态模型中的模态特异性退化提供了一种高效且实用的解决方案。

关键词

引用

@article{arxiv.2604.00829,
  title  = {LinguDistill: Recovering Linguistic Ability in Vision-Language Models via Selective Cross-Modal Distillation},
  author = {Patrick Amadeus Irawan and Erland Hilman Fuadi and Shanu Kumar and Alham Fikri Aji and Yova Kementchedjhieva},
  journal= {arXiv preprint arXiv:2604.00829},
  year   = {2026}
}