中文

非洲语言的大语言模型状态:进展与挑战

人工智能 2025-06-27 v3

摘要

大语言模型(LLMs)正在改变自然语言处理(NLP),但其利益在 Africa 的 2000 多种低资源语言中几乎不存在。本文对比分析了非洲语言覆盖情况,涵盖六个大语言模型、八个小型语言模型(SLMs)和六个专用小型语言模型(SSLMs)。评估包括语言覆盖、训练集、技术限制、脚本问题和语言建模路线图。工作识别出 42 种受支持的非洲语言和 23 个可用公共数据集,并显示出巨大的差距——四种语言(Amharic、Swahili、Afrikaans 和 Malagasy)始终被处理,而超过 98% 的非洲语言不受支持。此外,审查显示仅识别了 Latin、Arabic 和 Ge'ez 脚本,而忽略了 20 种活跃脚本。主要挑战包括数据不足、tokenization 偏见、计算成本极高以及评估问题。这些问题需要语言标准化、社区开发语料库以及针对非洲语言的有效适应方法。

关键词

引用

@article{arxiv.2506.02280,
  title  = {The State of Large Language Models for African Languages: Progress and Challenges},
  author = {Kedir Yassin Hussen and Walelign Tewabe Sewunetie and Abinew Ali Ayele and Sukairaj Hafiz Imam and Shamsuddeen Hassan Muhammad and Seid Muhie Yimam},
  journal= {arXiv preprint arXiv:2506.02280},
  year   = {2025}
}