中文

BanglaLlama:面向孟加拉语的 LLaMA

计算与语言 2025-10-08 v2 人工智能 机器学习

摘要

孟加拉语是一种约有 2.4 亿母语使用者和全球约 3 亿人使用的语言。尽管是世界上第五大语言,孟加拉语仍然是一种“低资源”语言,现有的预训练语言模型在孟加拉语语言处理(BLP)任务上往往表现不佳。本文通过以下方式弥补这一差距:(1)引入两个高质量的翻译孟加拉语指令数据集,总计 224k 样本——Bangla-Orca(172k)和 Bangla-Alpaca(52k);(2)利用这些数据集开发 BanglaLlama,一个开源的孟加拉语特定大语言模型(LLM)家族,包含五个基础版本和指令版本。我们展示了我们的方法论、两个大型数据集以及全面的基准测试结果,证明了我们的数据集和模型在多个基准测试上的有效性。我们相信,我们提出的数据集和模型将作为未来专注于这种广泛使用但“低资源”语言的研究的新标准基线。

关键词

引用

@article{arxiv.2410.21200,
  title  = {BanglaLlama: LLaMA for Bangla Language},
  author = {Abdullah Khan Zehady and Shubhashis Roy Dipta and Naymul Islam and Safi Al Mamun and Santu Karmaker},
  journal= {arXiv preprint arXiv:2410.21200},
  year   = {2025}
}