中文

金融基础模型的数据效率前沿:来自继续预训练的扩展规律

机器学习 2025-12-16 v1 计算与语言

摘要

领域适应预训练(DAPT)为在不进行完整再训练的情况下为高价值领域专门化大型语言模型提供了实用路径。我们对在美国SEC文件上继续预训练的1B和3B参数Llama-3.2模型进行早期阶段的扩展规律分析,训练语料为4亿token,在50M、100M、200M和400M token处设置验证检查点。结果显示,两类模型在SEC领域验证损失上均实现持续改进,其中最大提升发生在前2亿token内,之后出现报酬递减。幂律拟合显示指数较浅,表明金融语言高度规则且在继续预训练下高度可学习。一般领域验证损失在所有token预算下基本保持不变,表明模型变化微小且无 catastrophic forgetting迹象。数据效率前沿进一步表明,两类模型均趋向于更好的专业化,且混合领域性能 degradation 极小。综合这些发现,为金融基础模型的规模化提供了早期实证指导,表明以相对适中的token预算即可实现有意义的领域适应,更大模型规模(7B-70B)在预测的数据需求下仍具可行性。

关键词

引用

@article{arxiv.2512.12384,
  title  = {The Data Efficiency Frontier of Financial Foundation Models: Scaling Laws from Continued Pretraining},
  author = {Jesse Ponnock},
  journal= {arXiv preprint arXiv:2512.12384},
  year   = {2025}
}

备注

8 pages, 4 figures, 1 table