中文

MMMModal -- 多图像多音频多轮多模态

计算与语言 2024-02-20 v1

摘要

我们的贡献引入了一种突破性的多模态大型语言模型,旨在在单个多轮会话中理解多图像、多音频以及多图像 - 多音频组合。利用最先进的模型,我们采用 SigLIP 编码器处理视觉输入,采用 Whisper 编码器处理音频输入。值得注意的是,该多模态大型语言模型是双语的,能够同时精通理解英语和马来语。我们自豪地发布该模型的两个版本:拥有 11 亿参数的 TinyLlama 和拥有 70 亿参数的 Mistral。凭借其驾驭多种模态和语言的能力,我们的模型代表了马来西亚语境乃至更广泛领域的一项重大进步。所有模型发布于 https://huggingface.co/collections/mesolitica/multimodal-malaysian-llm-65c6f893e03f78fa9e5c8859

关键词

引用

@article{arxiv.2402.11297,
  title  = {MMMModal -- Multi-Images Multi-Audio Multi-turn Multi-Modal},
  author = {Husein Zolkepli and Aisyah Razak and Kamarul Adha and Ariff Nazhan},
  journal= {arXiv preprint arXiv:2402.11297},
  year   = {2024}
}