当更好的教师不让学生变得更好:重新审视 CLIP 模型 VQA 中的知识蒸馏
计算机视觉与模式识别
2025-11-25 v1 计算与语言
摘要
视觉语言模型(VLMs)在多模态任务中取得了显著的成功,但其巨大的计算需求阻碍了高效部署。知识蒸馏(KD)已成为构建轻量级但具竞争力的模型的强有力方法,语言和视觉领域都有充分证据支持。然而,其应用于VLMs,尤其是CLIP风格模型,仍有限,常局限于小规模教师和狭窄评估任务,如分类或检索。在本工作中,我们进行了对CLIP风格教师模型(从标准基线到大规模SOTA模型)进行蒸馏的首次系统性研究。与NLP和视觉中所观察到的趋势相反,我们发现更强的教师并不一致产生更好的学生;事实上,现有蒸馏框架往往难以扩展,导致在视觉问答等下游多模态任务中性能下降。我们的发现挑战了KD中的既有假设,指向设计参数高效多模态模型的新方向。
引用
@article{arxiv.2511.17886,
title = {When Better Teachers Don't Make Better Students: Revisiting Knowledge Distillation for CLIP Models in VQA},
author = {Pume Tuchinda and Parinthapat Pengpun and Romrawin Chumpu and Sarana Nutanong and Peerat Limkonchotiwat},
journal= {arXiv preprint arXiv:2511.17886},
year = {2025}
}