BREEN:基于可学习查询的数据高效无编码器多模态学习
计算机视觉与模式识别
2025-03-18 v1 人工智能
摘要
无编码器多模态大语言模型(MLLM)通过直接处理图像标记在语言模型前消除对已训练视觉编码器的需求,减少计算开销和模型复杂度,但通常需要大量训练数据才能有效捕获视觉知识。缺乏视觉编码器意味着模型可能依赖大量数据来学习必要的视觉-语义对齐。在本工作中,我们提出BREEN,这是一种数据高效无编码器多模态架构,用于缓解此问题。BREEN利用可学习查询和图像专家,在显著减少训练数据的情况下实现与现有方法相当的性能。可学习查询位于图像和文本标记之间,由预训练CLIP模型的输出监督,以蒸馏视觉知识,弥合视觉与文本模态之间的差距。此外,图像专家独立处理图像标记和可学习查询,提高效率并减少与LLM文本能力的干扰。BREEN仅使用约1300万文本-图像对训练,即可实现与Mono-InternVL等现有无编码器SOTA模型相当的性能。我们的工作显示了数据高效无编码器多模态学习的前景方向,为传统编码器方法提供了替代方案。
引用
@article{arxiv.2503.12446,
title = {BREEN: Bridge Data-Efficient Encoder-Free Multimodal Learning with Learnable Queries},
author = {Tianle Li and Yongming Rao and Winston Hu and Yu Cheng},
journal= {arXiv preprint arXiv:2503.12446},
year = {2025}
}