中文

CroissantLLM:面向实际需求的双语法语-英语语言模型

计算与语言 2025-04-10 v5 机器学习

摘要

我们介绍 CroissantLLM,这是一个 13 亿参数的语言模型,通过在 30 亿英法 token 上进行预训练,为研究和工业界带来一个高性能、完全开源的双语模型,能够在消费级本地硬件上快速运行。为此,我们首次采用 1:1 的英法预训练数据比例、定制化分词器以及双语微调数据集来训练内在双语模型。我们发布了训练数据集,其中包含经过手动精心挑选、质量高且数据来源多样的法语数据子集。为评估英语之外的表现,我们构建了一个新型基准 FrenchBench,包含分类与生成任务,涵盖法语语言模型性能各个正交维度。此外,立足于透明度,为促进大型语言模型研究,我们发布了代码库以及数十个不同模型规模、训练数据分布和训练步数的检查点,以及微调聊天模型和强大的翻译模型。我们通过 FMTI 框架评估我们的模型,验证了 81% 的透明度指标,远超大多数开源项目的得分。这一工作丰富了 NLP 领域,摆脱了以前以英语为中心的工作,加强了对语言模型中多语言性的理解。

关键词

引用

@article{arxiv.2402.00786,
  title  = {CroissantLLM: A Truly Bilingual French-English Language Model},
  author = {Manuel Faysse and Patrick Fernandes and Nuno M. Guerreiro and António Loison and Duarte M. Alves and Caio Corro and Nicolas Boizard and João Alves and Ricardo Rei and Pedro H. Martins and Antoni Bigata Casademunt and François Yvon and André F. T. Martins and Gautier Viaud and Céline Hudelot and Pierre Colombo},
  journal= {arXiv preprint arXiv:2402.00786},
  year   = {2025}
}