基于大语言模型的多维度知识蒸馏
计算机视觉与模式识别
2025-04-15 v4
摘要
近期深度学习进展显著提升了计算机视觉任务的性能。以往的图像分类方法主要修改模型架构或添加特征,通过对类别logits的交叉熵损失进行优化。由于它们关注通过类别标签对图像进行分类,这些方法可能难以学习类别的各种“维度”(例如,自然位置和形状变化)。我们从新颖的视角重新思考此前方法,提出一种基于多模态大语言模型(MLLM)的多维度知识蒸馏方法。我们的做法包括:1)查询大语言模型,针对我们希望传递给模型的知识提出多维度问题;2)从MLLM中提取相应的logits;3)扩展模型的输出维度,以蒸馏这些多维度logits。随后,我们对类别logits应用交叉熵损失,对多维度logits应用二元交叉熵损失。通过该方法,模型不仅能学习关于视觉维度的知识,还能学习需要更深层次理解的抽象和复杂维度。我们主要将该方法应用于图像分类,探索将模型扩展至目标检测等任务的潜力。所有实验结果表明,该方法提升了基线方法的性能。此外,我们分析了多维度知识蒸馏的效果。结果表明,该方法能够将关于各种维度的知识传递给模型,维度知识可提升计算机视觉任务中的模型性能。
引用
@article{arxiv.2501.13341,
title = {Multi-aspect Knowledge Distillation with Large Language Model},
author = {Taegyeong Lee and Jinsik Bang and Soyeong Kwon and Taehwan Kim},
journal= {arXiv preprint arXiv:2501.13341},
year = {2025}
}
备注
Accept to CVPRW2025 (FGVC12)