中文

Gaperon:一套泛化的英法生成语言模型

计算与语言 2025-10-30 v1 人工智能

摘要

我们发布 Gaperon,一个完全开放的法英-编码语言模型套件,旨在推动大规模模型训练的透明度和可重复性。Gaperon 系列包括 15B、8B 和 24B 参数模型,训练于 2-4 万亿标记,随所有训练管道元素发布:经神经质量分类器筛选的法语和英语数据集、高效的数据策展和训练框架,以及数百个中间检查点。通过本工作,我们研究了数据筛选和污染如何塑造基准和生成性能。我们发现,针对语言质量进行筛选可提升文本流畅度和连贯性,但会产生不佳的基准结果;而晚期刻意污染——继续训练包含测试集的数据混合物——可恢复竞争性得分,同时仅对生成质量造成合理损害。我们讨论了常规神经筛选如何无意中放大基准泄漏。为支持进一步的研究,我们还引入了预训练期间的无害数据投毒,为安全研究提供了现实可测试的基座。通过公开发布所有模型、数据集、代码和检查点,Gaperon 为探索数据策展、评估、安全和开放性在多语言语言模型开发中的权衡 establish 了可重复的基础。

关键词

引用

@article{arxiv.2510.25771,
  title  = {Gaperon: A Peppered English-French Generative Language Model Suite},
  author = {Nathan Godey and Wissam Antoun and Rian Touchent and Rachel Bawden and Éric de la Clergerie and Benoît Sagot and Djamé Seddah},
  journal= {arXiv preprint arXiv:2510.25771},
  year   = {2025}
}