中文

ToVE:通过来自视觉专家的知识传递实现高效视觉语言学习

计算机视觉与模式识别 2025-04-02 v1

摘要

视觉语言(VL)学习需要广泛的视觉感知能力,例如精细的对象识别和空间感知。最近的工作通常依赖在大型数据集上训练大型模型来开发这些能力。作为一种更高效的替代方案,本文提出了一种新的框架,通过将来自众多视觉专家的知识传递(ToVE)来实现高效VL学习,利用预训练的视觉专家模型来促进视觉感知能力。具体而言,基于冻结的 CLIP 编码器提供图像条件语言生成的视觉标记,ToVE 引入多个视觉专家和一个面向视觉标记的门控网络,动态将专家知识路由到视觉标记。在传递阶段,我们提出了一种“残差知识传递”策略,这不仅保留了视觉标记的通用性,还允许分离低贡献专家以提高推理效率。进一步,我们探索将这些专家知识合并到单个 CLIP 编码器中,创建一个知识合并后的 CLIP 编码器,该编码器在部署期间无需专家推理即可生成更具信息性的视觉标记。跨越各种 VL 任务的实验结果表明,所提出的 ToVE 在各种 VL 任务上均实现了与当前方法相当的性能,仅需两数量级更少的训练数据。

关键词

引用

@article{arxiv.2504.00691,
  title  = {ToVE: Efficient Vision-Language Learning via Knowledge Transfer from Vision Experts},
  author = {Yuanchen Wu and Junlong Du and Ke Yan and Shouhong Ding and Xiaoqiang Li},
  journal= {arXiv preprint arXiv:2504.00691},
  year   = {2025}
}

备注

Accepted to ICLR 2025