从图像到文字:基于黑盒教师的高效跨模态知识蒸馏
计算与语言
2026-03-12 v1
摘要
知识蒸馏(KD)方法在将大型预训练语言模型压缩到小型模型以确保计算效率而不显著降低性能方面起到了关键作用。传统的 KD 技术假设教师(源)模型和学生(目标)模型之间的模态一致性。另一方面,现有的多模态知识蒸馏方法需要教师模型的模态特定预训练,这在大多数情况下是计算上不可行的。在本文中,我们引入了 ARMADA—a 一个高效的跨模态知识蒸馏框架,用于将来自大型视觉语言模型(包括黑盒模型)的知识蒸馏到语言模型。与现有 KD 技术依赖于多模态教师的内部结构或需要计算密集型预训练不同,ARMADA 利用新颖的对齐技术进行蒸馏,而无需更改教师模型,确保高效和可扩展性。我们在十二个自然语言理解、八个复杂生成推理和五个指令调优任务上对 ARMADA 进行了实证验证,证明在大型模型(如 DeBERTa-v2-1.4B、OPT-1.3B、LLaMA-{3B, 7B, 8B})上实现了一致的性能提升。在语言理解任务中实现最高可达 3.4% 的提升,在生成推理中实现 2.6% 的提升,所有这些都无需对教师模型进行昂贵的多模态预训练或微调。我们的发现挑战了传统的知识蒸馏范式,表明即使是视觉语言模型尽管缺乏直接的文本理解能力,但只要蒸馏方式恰当,其仍能显著增强语言模型。
引用
@article{arxiv.2603.10877,
title = {From Images to Words: Efficient Cross-Modal Knowledge Distillation to Language Models from Black-box Teachers},
author = {Ayan Sengupta and Shantanu Dixit and Md Shad Akhtar and Tanmoy Chakraborty},
journal= {arXiv preprint arXiv:2603.10877},
year = {2026}
}