AIN:阿拉伯语包容性大型多模态模型
计算机视觉与模式识别
2025-02-06 v2 人工智能
计算与语言
人机交互
机器学习
摘要
在大型语言模型(LLMs)及其向大型多模态模型(LMMs)演进的快速进展中,英语和汉语等高资源语言取得了重大进展。虽然阿拉伯语 LLMs 取得了显著进步,但阿拉伯语 LMMs 在很大程度上仍未得到探索,通常仅狭隘地关注语言和视觉理解的少数特定方面。为弥合这一差距,我们引入了 AIN——阿拉伯语包容性多模态模型——旨在跨不同领域表现出色。AIN 是一个英阿双语 LMM,旨在精通英语和阿拉伯语,利用了精心构建的 360 万高质量阿拉伯语-英语多模态数据样本。AIN 展示了最先进的阿拉伯语性能,同时也具备强大的英语视觉能力。在最近的 CAMEL-Bench 基准测试中,该基准包含 38 个子领域,包括多图像理解、复杂视觉感知、手写文档理解、视频理解、医学影像、植物病害和基于遥感的土地利用理解,我们的 AIN 表现出强大的性能,其 7B 模型在八个领域和 38 个子领域的平均得分上,绝对增益超过 GPT-4o 3.4%。AIN 的卓越能力使其成为朝着为阿拉伯语使用者提供跨多种应用的先进多模态生成式 AI 工具迈出的重要一步。
引用
@article{arxiv.2502.00094,
title = {AIN: The Arabic INclusive Large Multimodal Model},
author = {Ahmed Heakl and Sara Ghaboura and Omkar Thawkar and Fahad Shahbaz Khan and Hisham Cholakkal and Rao Muhammad Anwer and Salman Khan},
journal= {arXiv preprint arXiv:2502.00094},
year = {2025}
}
备注
20 pages, 16 figures, ACL