TituLLMs:一组具有全面基准测试的孟加拉语大语言模型
计算与语言
2025-06-09 v3 人工智能
摘要
在本文中,我们提出了 TituLLMs,这是首批大规模预训练的孟加拉语大语言模型,提供 1B 和 3B 参数规模。由于训练和推理过程中的计算约束,我们专注于较小的模型。为了训练 TituLLMs,我们收集了约 370 亿个 token 的预训练数据集。我们扩展了 Llama-3.2 分词器以融入语言和文化特定的知识,这也使得训练和推理更加快速。缺乏用于评估孟加拉语大语言模型的基准数据集。为了填补这一空白,我们开发了五个基准测试数据集。我们对多种大语言模型进行了基准测试,包括 TituLLMs,并证明 TituLLMs 优于其初始多语言版本。然而,并非总是如此,这凸显了语言适应的复杂性。我们的工作为将现有的多语言开源模型适配到其他低资源语言奠定了基础。为了促进更广泛的采用和进一步研究,我们已将 TituLLMs 模型和基准测试数据集公开发布。
引用
@article{arxiv.2502.11187,
title = {TituLLMs: A Family of Bangla LLMs with Comprehensive Benchmarking},
author = {Shahriar Kabir Nahin and Rabindra Nath Nandi and Sagor Sarker and Quazi Sarwar Muhtaseem and Md Kowsher and Apu Chandraw Shill and Md Ibrahim and Mehadi Hasan Menon and Tareq Al Muntasir and Firoj Alam},
journal= {arXiv preprint arXiv:2502.11187},
year = {2025}
}
备注
LLMs, Benchmarking, Large Language Models, Bangla, BanglaLLMs