Libra:基于大语言模型的解耦视觉系统
计算机视觉与模式识别
2024-05-17 v1
摘要
本 work 引入了 Libra,一个在大语言模型 (LLM) 基础上构建解耦视觉系统的原型模型。解耦视觉系统将内部模态建模与跨模态交互解耦,实现独特的视觉信息建模和有效的跨模态理解。Libra 通过在视觉和语言输入上进行离散自回归建模进行训练。具体而言,我们将一个路由视觉专家和一个跨模态桥接模块集成到预训练的 LLM 中,以在注意力计算期间路由视觉和语言流,实现内部模态建模和跨模态交互场景中的不同注意力模式。实验结果表明,Libra 专门的设计实现了一个强大的 MLLM 基准,仅用 5000 万训练数据即可与现有工作在图像到文本场景中相抗衡,为未来多模态基础模型提供了新的视角。代码已公开于 https://github.com/YifanXu74/Libra。
引用
@article{arxiv.2405.10140,
title = {Libra: Building Decoupled Vision System on Large Language Models},
author = {Yifan Xu and Xiaoshan Yang and Yaguang Song and Changsheng Xu},
journal= {arXiv preprint arXiv:2405.10140},
year = {2024}
}
备注
ICML2024