Florence-VL:通过生成式视觉编码器和深度-宽度融合增强视觉-语言模型
计算机视觉与模式识别
2024-12-06 v1 人工智能
摘要
我们提出 Florence-VL,这是一套新的多模态大语言模型 (MLLM),其视觉表示由 Florence-2 生成式视觉基础模型提供。不同于广泛使用的通过对比学习训练的 CLIP 风格视觉变换器,Florence-2 能够捕获不同层次和方面的视觉特征,这些特征更灵活地可适应于多样化的下游任务。我们提出了一种新颖的特征融合架构和创新的训练配方,有效地将 Florence-2 的视觉特征整合到预训练的 LLM 中,如 Phi 3.5 和 Llama 3。特别是,我们提出了"深度-宽度融合 (DBFusion)",以融合来自不同深度和多模态提示下的视觉特征。我们的模型训练由整个模型的端到端预训练 followed by 投影层和 LLM 的微调组成,采用精心设计的多样化开源数据集配方,包括高质量图像描述和指令调优对。我们的定量分析和 Florence-VL 视觉特征可视化显示,其在视觉-语言对齐方面优于流行的视觉编码器,其中丰富的深度和宽度在起重要作用。Florence-VL 在涵盖通用 VQA、感知、幻觉、OCR、图表、知识密集型理解等 various 多模态和视觉中心基准测试上显著优于现有的 SOTA MLLM。为促进未来研究,我们将模型和完整的训练配方开源。https://github.com/JiuhaiChen/Florence-VL
引用
@article{arxiv.2412.04424,
title = {Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion},
author = {Jiuhai Chen and Jianwei Yang and Haiping Wu and Dianqi Li and Jianfeng Gao and Tianyi Zhou and Bin Xiao},
journal= {arXiv preprint arXiv:2412.04424},
year = {2024}
}