ArXiv-to-Model:科学语言模型训练的实用研究
人工智能
2026-02-20 v1 计算与语言
摘要
虽然前沿大型语言模型在推理和数学能力方面表现突出,但从原始数据源直接训练领域专业科学语言模型的实际过程仍缺乏文档。本文我们对从arXiv LaTeX 源文件(涵盖数学、计算机科学和理论物理)中直接训练一个13.6亿参数科学语言模型进行了详尽的案例研究。我们描述了一个从头到尾的管道,包括元数据过滤、档案验证、LaTeX 提取、文本规范化、领域感知分词以及受限计算资源(2xA100 GPU)下的稠密 Transformer 训练。通过24次实验运行,我们分析了训练稳定性、规模效应、数据产出损失以及基础设施瓶颈。我们的发现表明,预处理决策显著影响可用标记量、分词对符号稳定性的影响,以及存储和 I/O 约束可与计算资源相当成为限制因素。我们进一步分析了收敛动力学,表明在数据丰富的条件下(520亿预训练标记)可实现稳定的训练行为。本工作并不提出新型架构,而是提供了一个以工程为基础、透明的从零开始训练小型科学语言模型的过程。我们希望这些见解能支持在计算资源有限的情况下寻求构建领域专业模型的研究人员。
关键词
引用
@article{arxiv.2602.17288,
title = {ArXiv-to-Model: A Practical Study of Scientific LM Training},
author = {Anuj Gupta},
journal= {arXiv preprint arXiv:2602.17288},
year = {2026}
}
备注
15 pages, 6 figures, 1 table