中文

Curi\'o-Edu 7B:探讨LLM持续预训练中数据选择的影响

计算与语言 2025-12-16 v1

摘要

持续预训练通过进一步暴露于特定语言或领域上下文的额外数据来扩展语言模型的功能,这一策略已成为一种高效替代方案,用于在新环境中调整通用模型。本文通过Curi\'o 7B——一个源自LLaMA-2的70亿参数模型,基于来自ClassiCC-PT语料库的1000亿葡萄牙语token进行训练——来探索这一范式。该语料库是目前规模最大的葡萄牙语特定持续预训练工作之一。除规模因素外,我们还调查了数量alone是否足够,还是数据质量在语言适应中发挥决定性作用。为此,我们引入了Curi\'o-Edu 7B,一个仅在同一语料库的教育和STEM过滤子集上训练的变体,总计仅100亿token。尽管仅使用10%的数据和20%的计算量,Curi\'o-Edu 7B仍在我们的评估中超过了完整语料库模型,表明即使在针对目标语言有限先验暴露的情况下,数据选择仍是适应模型的关键因素。开发的模型可在https://huggingface.co/collections/ClassiCC-Corpus/curio-edu上获得。

关键词

引用

@article{arxiv.2512.12770,
  title  = {Curi\'o-Edu 7B: Examining Data Selection Impacts in LLM Continued Pretraining},
  author = {Thales Sales Almeida and Rodrigo Nogueira and Hélio Pedrini},
  journal= {arXiv preprint arXiv:2512.12770},
  year   = {2025}
}