中文

计算约束下的小型语言模型架构权衡

计算与语言 2025-12-25 v1 机器学习

摘要

我们进行了一项关于严格计算约束下小型语言模型的系统经验研究,分析了架构选择和训练预算如何相互决定性能。我们从线性后续标记预测模型开始,逐步引入非线性、自注意力机制和多层Transformer架构,在Tiny Shakespeare的字符级建模以及Penn Treebank (PTB) 和 WikiText-2 词级建模中对每个模型进行评估。我们使用测试负对数似然 (NLL)、参数数量和近似训练浮点运算次数来比较模型,以刻画准确性与效率之间的权衡。我们的结果表明,在小规模模型中,注意力机制类模型在每 FLOP 效率上占据优势,尽管增加深度或上下文而缺乏足够优化仍可能导致性能下降。我们进一步考察了旋转位置编码 (RoPE),发现在大型语言模型中成功的架构技术并不一定能在小模型 regime 中移植。

关键词

引用

@article{arxiv.2512.20877,
  title  = {Architectural Trade-offs in Small Language Models Under Compute Constraints},
  author = {Shivraj Singh Bhatti},
  journal= {arXiv preprint arXiv:2512.20877},
  year   = {2025}
}

备注

15 pages, 11 images