中文

BgGPT 1.0:将以英语为中心的大语言模型扩展至其他语言

计算与语言 2024-12-17 v1 人工智能 机器学习

摘要

我们提出BgGPT-Gemma-2-27B-Instruct和BgGPT-Gemma-2-9B-Instruct:Google Gemma-2模型的持续预训练和微调版本,专为Bulgarian语言理解和生成优化。借助Gemma-2的多语言能力以及超过1000亿token的Bulgarian和English文本数据,我们的模型在Bulgarian语言任务中表现出色,制定了面向语言特定AI模型的新标准。我们的做法保持了原始Gemma-2模型的强大能力,确保英语语言性能得以维持。为保留基础模型能力,我们采用基于最新分支-合并技术的持续学习策略,以及对训练数据的彻底精选和筛选。我们提供关于方法的详细见解,包括在商业友好许可下发布模型权重,以便为研究人员、公司和爱好者采用。进一步地,我们建立了一套基于非公开教育数据源的综合基准测试,用于评估Bulgarian语言任务中的模型,以及安全性和聊天功能。我们的发现表明,针对像Gemma 2这样的前沿模型进行微调,以增强面向特定语言的AI应用,同时保持跨语言能力方面效果显著。

关键词

引用

@article{arxiv.2412.10893,
  title  = {BgGPT 1.0: Extending English-centric LLMs to other languages},
  author = {Anton Alexandrov and Veselin Raychev and Dimitar I. Dimitrov and Ce Zhang and Martin Vechev and Kristina Toutanova},
  journal= {arXiv preprint arXiv:2412.10893},
  year   = {2024}
}