中文

LLaVaOLMoBitnet1B:三值多模态大语言模型

机器学习 2024-09-04 v2

摘要

多模态大语言模型 (MM-LLM) 在过去一年中取得了显著进展,展现出惊人的跨任务性能。然而,要实现真正的 AI 普及,模型必须具备强大的能力,同时能在大多数人可及的小型计算资源上高效运行。为此,我们介绍 LLaVaOLMoBitnet1B——首个能够接受图像+文本输入并生成连贯文本响应的三值多模态大语言模型。该模型完全开源,附带训练脚本,以鼓励进一步研究。本技术报告概述了训练过程、评估细节、三值模型的挑战以及未来机遇。模型链接:https://huggingface.co/IntelLabs/LlavaOLMoBitnet1B

关键词

引用

@article{arxiv.2408.13402,
  title  = {LLaVaOLMoBitnet1B: Ternary LLM goes Multimodal!},
  author = {Jainaveen Sundaram and Ravi Iyer},
  journal= {arXiv preprint arXiv:2408.13402},
  year   = {2024}
}