中文

DeepSeek-VL2:面向高级多模态理解的混合专家视觉语言模型

计算机视觉与模式识别 2024-12-16 v1 人工智能 计算与语言

摘要

我们提出 DeepSeek-VL2,这是一个在其前身 DeepSeek-VL 基础上显著提升的大型混合专家 (MoE) 视觉语言模型系列。对于视觉组件,我们采用针对不同宽高比的高分辨率图像设计的动态瓦片视觉编码策略。对于语言组件,我们利用具备 Multi-head Latent Attention 机制的 DeepSeekMoE 模型,将 Key-Value 缓存压缩为潜在向量,从而实现高效推理和高吞吐。我们在改进的视觉语言数据集上进行训练,DeepSeek-VL2 在各种任务中展现出卓越的能力,包括但不限于视觉问答、光学字符识别、文档/表格/图表理解以及视觉定位。我们的模型系列包含三个变体:DeepSeek-VL2-Tiny、DeepSeek-VL2-Small 和 DeepSeek-VL2,分别激活参数为 10 亿、28 亿和 45 亿。DeepSeek-VL2 在与现有开源稠密和 MoE 模型相比时,凭借相似或更少的激活参数,实现了竞争甚至领先的性能。代码和预训练模型均公开访问于 https://github.com/deepseek-ai/DeepSeek-VL2。

关键词

引用

@article{arxiv.2412.10302,
  title  = {DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding},
  author = {Zhiyu Wu and Xiaokang Chen and Zizheng Pan and Xingchao Liu and Wen Liu and Damai Dai and Huazuo Gao and Yiyang Ma and Chengyue Wu and Bingxuan Wang and Zhenda Xie and Yu Wu and Kai Hu and Jiawei Wang and Yaofeng Sun and Yukun Li and Yishi Piao and Kang Guan and Aixin Liu and Xin Xie and Yuxiang You and Kai Dong and Xingkai Yu and Haowei Zhang and Liang Zhao and Yisong Wang and Chong Ruan},
  journal= {arXiv preprint arXiv:2412.10302},
  year   = {2024}
}