HAWAII:面向高效视觉-语言模型的层次化视觉知识传递
计算机视觉与模式识别
2025-11-21 v2 人工智能
计算与语言
摘要
提高视觉-语言模型(VLMs)的视觉理解能力对于增强其在各种任务上的性能至关重要。虽然使用多个预训练视觉专家显示出巨大的前景,但这往往会在训练和推理期间造成显著的计算成本。为此,我们提出了 HAWAII,一种新型框架,通过从多个视觉专家蒸馏知识到单个视觉编码器中,以实现最小的计算开销即可继承多个专家的互补优势。为缓解不同教师之间的冲突以及在不同教师特定知识之间切换,本文不使用固定的多个教师适配器集合,而是提出使用教师特定的低秩适应(LoRA)适配器配合相应的路由器。每个适配器均与特定教师对齐,从而避免在蒸馏期间出现噪声式指导。为实现高效知识蒸馏,本文提出细粒度和粗粒度蒸馏。细粒度层面,采用标记重要性得分来自适应地强调来自每个教师的最信息化标记。粗粒度层面,我们对多个教师的知识进行总结,并通过一组通用知识 LoRA 适配器配合路由器将其传递给学生。针对各种视觉-语言任务进行大量实验,表明 HAWAII 在各种流行开源 VLMs 上具有优越性。代码已公开于 https://github.com/yimuwangcs/wise-hawaii。
引用
@article{arxiv.2506.19072,
title = {HAWAII: Hierarchical Visual Knowledge Transfer for Efficient Vision-Language Models},
author = {Yimu Wang and Mozhgan Nasr Azadani and Sean Sedwards and Krzysztof Czarnecki},
journal= {arXiv preprint arXiv:2506.19072},
year = {2025}
}
备注
NeurIPS 2025