中文

DeepSpeed-VisualChat:基于多模态因果注意力的多轮多图像交错对话

计算机视觉与模式识别 2023-11-30 v3 计算与语言

摘要

现有多数多模态模型因无法熟练处理多图像、多轮对话中的交错图像-文本输入,且在训练资源分配与数据可及性上面临显著限制,影响了其在不同交互领域的适应性与可扩展性。为此,我们提出 DeepSpeed-VisualChat 框架,旨在通过融入多模态能力来优化大语言模型 (LLMs),重点提升大视觉语言模型在处理交错输入上的熟练度。我们的框架显著之处在于:(1) 其对多轮多图像对话的开源支持;(2) 引入创新的多模态因果注意力机制;(3) 在现有数据集上运用数据混合技术,以保障多轮多图像对话中的无缝交互。与现有框架相比,DeepSpeed-VisualChat 展现出高达 70B 参数语言模型规模的优越可扩展性,代表了多模态语言模型的重大进展,并为未来探索奠定坚实基础。

关键词

引用

@article{arxiv.2309.14327,
  title  = {DeepSpeed-VisualChat: Multi-Round Multi-Image Interleave Chat via Multi-Modal Causal Attention},
  author = {Zhewei Yao and Xiaoxia Wu and Conglong Li and Minjia Zhang and Heyang Qin and Olatunji Ruwase and Ammar Ahmad Awan and Samyam Rajbhandari and Yuxiong He},
  journal= {arXiv preprint arXiv:2309.14327},
  year   = {2023}
}