中文

Amharic LLaMA 与 LLaVA:面向低资源语言的多模态LLM

计算与语言 2024-03-12 v1

摘要

诸如 GPT-4 和 LLaMA 这样的大型语言模型(LLM)在自然语言处理任务上展现出了惊人的能力,甚至开始在视觉和音频等其他模态的任务中表现出色。尽管取得了成功,但由于可用的训练数据极少,LLM 在低资源语言上往往表现不佳。这一缺点在开源模型中尤为普遍。在这项工作中,我们探索训练 LLaMA-2 说出 Amharic 语,这是一种全球有超过 5000 万人使用的语言,但其可用数据比英语等语言少几个数量级。我们采用以前用于在数据稀缺的其他语言上训练 LLM 的方法,并使用开源翻译模型进行数据增强,将我们的数据集从数百万 token 增长到数十亿。我们进一步通过连接图像编码器并以与 LLaVA 相同的方式在翻译的视觉指令微调数据集上进行训练,从而增强了我们模型的能力,产生了一个能够理解图像和文本的多模态 Amharic LLM。我们引入了一个流行基准数据集的 Amharic 版本来评估我们的工作。我们的模型和数据集已开源并在 GitHub 上提供。

关键词

引用

@article{arxiv.2403.06354,
  title  = {Amharic LLaMA and LLaVA: Multimodal LLMs for Low Resource Languages},
  author = {Michael Andersland},
  journal= {arXiv preprint arXiv:2403.06354},
  year   = {2024}
}