中文

MammothModa:多模态大语言模型

计算机视觉与模式识别 2024-06-27 v1 人工智能

摘要

本报告介绍了 MammothModa,这是另一种旨在从基础基线开始实现最先进性能的多模态大语言模型 (MLLM)。我们关注三个关键设计理念:(i) 在保持复杂语言理解能力的同时集成视觉能力:除了视觉编码器外,我们还将视觉注意力专家整合到 LLM 中,以增强其视觉能力。(ii) 扩展高分辨率和长时程视觉特征的上下文窗口:我们探索了视觉合并模块以有效减少高分辨率图像的 token 数量,并 incorporated 帧位置 ID 以避免位置插值。(iii) 高质量双语数据集:我们仔细筛选并构建了高质量的双语多模态数据集以减少视觉幻觉。通过上述配方,我们构建的 MammothModa 在各种主要实际场景的视觉语言基准测试中(如 LLaVA 系列)均表现出色,且无需复杂的技巧。

关键词

引用

@article{arxiv.2406.18193,
  title  = {MammothModa: Multi-Modal Large Language Model},
  author = {Qi She and Junwen Pan and Xin Wan and Rui Zhang and Dawei Lu and Kai Huang},
  journal= {arXiv preprint arXiv:2406.18193},
  year   = {2024}
}

备注

Technical report