中文

Peacock:面向阿拉伯语的多模态大语言模型家族与基准测试

计算与语言 2024-05-28 v2 人工智能

摘要

多模态大语言模型(MLLMs)在需要复杂推理和语言理解的广泛任务中已证明有效。然而,由于缺乏除英语之外其他语言的高质量多模态资源,MLLMs的成功相对局限于英语为主的场景。这给开发面向其他语言的相当模型带来了重大挑战,即便是说话人数众多的阿拉伯语也不例外。为缓解这一挑战,我们介绍了一套全面的阿拉伯语MLLMs家族,称为\textit{Peacock},具备强大的视觉与语言能力。通过全面的定性和定量分析,我们展示了模型在various视觉推理任务上的卓越表现,并进一步显示其在方言语言方面的潜在能力。此外,我们引入\textit{Henna}——一个专为评估与阿拉伯文化相关方面而设计的新型基准测试,为构建具有文化意识的阿拉伯语MLLMs奠定了基础。\textit{Peacock}项目的GitHub仓库已公开,地址为\url{https://github.com/UBC-NLP/peacock}。

关键词

引用

@article{arxiv.2403.01031,
  title  = {Peacock: A Family of Arabic Multimodal Large Language Models and Benchmarks},
  author = {Fakhraddin Alwajih and El Moatez Billah Nagoudi and Gagan Bhatia and Abdelrahman Mohamed and Muhammad Abdul-Mageed},
  journal= {arXiv preprint arXiv:2403.01031},
  year   = {2024}
}