连接巨型:大型多模态模型的协同知识传递用于少样本学习
计算机视觉与模式识别
2025-10-14 v1 多媒体
摘要
少样本学习(FSL)旨在解决以有限训练样本分类新类的挑战。虽然某些方法利用较小规模模型的语义知识来缓解数据稀缺问题,但这些方法常因数据本质简单性引入噪声和偏差。在本文中,我们提出一种新框架——协同知识传递(SynTrans),有效地将来自大型多模态模型的多样且互补知识传递给强大的数据稀缺学习器。具体而言,SynTrans 使用 CLIP 作为稳健的教师,采用少样本视觉编码器作为弱学生,通过无监督的代理任务提取语义对齐的视觉知识。随后,一个训练自由的协同知识挖掘模块促进大型多模态模型之间的协作,以提取高质量的语义知识。基于此,一个视觉-语义桥接模块实现视觉与语义空间之间的双向知识传递,将显式视觉知识和隐式语义知识转化为类别特定的分类器权重。最后,SynTrans 引入视觉权重生成器和语义权重重构器,以适应性地构建最优的多模态FSL分类器。实验结果表明,SynTrans 即使搭配简单的数据稀缺视觉编码器,也显著优于当前最新方法。
引用
@article{arxiv.2510.11115,
title = {Connecting Giants: Synergistic Knowledge Transfer of Large Multimodal Models for Few-Shot Learning},
author = {Hao Tang and Shengfeng He and Jing Qin},
journal= {arXiv preprint arXiv:2510.11115},
year = {2025}
}
备注
Accepted by IJCAI 2025