中文

Lucie-7B 大语言模型与 Lucie 训练数据集:多语言语言生成的开放资源

计算与语言 2025-03-18 v1 人工智能

摘要

我们同时发布了 Lucie 训练数据集和 Lucie-7B 基础模型。Lucie 训练数据集是一个以法语为中心的多语言文本语料库集合,旨在抵消许多大型语言模型预训练数据集中存在的以英语为中心的偏差。其法语数据不仅来自传统网络来源,还来自法国文化遗产文献,填补了现代数据集中的一个重要空白。除占数据最大份额的法语外,我们还添加了支持其他几种欧洲语言的文档,包括英语、西班牙语、德语和意大利语。除了作为法语和文化遗产资源的价值外,该数据集的一个重要特点是它通过最小化受版权保护的材料来优先考虑数据权利。此外,秉承过去开放项目的理念,它以训练所用形式重新分发,其处理过程在 Hugging Face 和 GitHub 上有详细描述。Lucie-7B 基础模型在法语和英语数据量大致相等(约各占 33%)的条件下进行训练,以更好地代表法语社区的文化方面。我们还描述了两种指令微调模型,Lucie-7B-Instruct-v1.1 和 Lucie-7B-Instruct-human-data,作为 Lucie-7B 实际应用的演示而发布。这些模型与最先进模型相比取得了有前景的结果,证明了优先考虑数据权利的开放方法仍然可以提供强大的性能。我们将这些模型视为在不久的将来开发性能更强、对齐更好的模型的初步步骤。Lucie-7B 和 Lucie 指令微调模型的模型权重,以及前者的中间检查点,已发布在 Hugging Face 上,而模型训练和数据准备代码可在 GitHub 上获取。这使 Lucie-7B 成为根据新 OSI 定义首批符合 OSI 规范的语言模型之一。

关键词

引用

@article{arxiv.2503.12294,
  title  = {The Lucie-7B LLM and the Lucie Training Dataset: Open resources for multilingual language generation},
  author = {Olivier Gouvert and Julie Hunter and Jérôme Louradour and Christophe Cerisara and Evan Dufraisse and Yaya Sy and Laura Rivière and Jean-Pierre Lorré and OpenLLM-France community},
  journal= {arXiv preprint arXiv:2503.12294},
  year   = {2025}
}