LLaVaOLMoBitnet1B:三值多模态大语言模型
机器学习
2024-09-04 v2
摘要
多模态大语言模型 (MM-LLM) 在过去一年中取得了显著进展,展现出惊人的跨任务性能。然而,要实现真正的 AI 普及,模型必须具备强大的能力,同时能在大多数人可及的小型计算资源上高效运行。为此,我们介绍 LLaVaOLMoBitnet1B——首个能够接受图像+文本输入并生成连贯文本响应的三值多模态大语言模型。该模型完全开源,附带训练脚本,以鼓励进一步研究。本技术报告概述了训练过程、评估细节、三值模型的挑战以及未来机遇。模型链接:https://huggingface.co/IntelLabs/LlavaOLMoBitnet1B
引用
@article{arxiv.2408.13402,
title = {LLaVaOLMoBitnet1B: Ternary LLM goes Multimodal!},
author = {Jainaveen Sundaram and Ravi Iyer},
journal= {arXiv preprint arXiv:2408.13402},
year = {2024}
}