中文

PaPaformer:来自预训练平行路径的语言模型

计算与语言 2025-08-11 v2 机器学习

摘要

现代大型语言模型的训练需要越来越多的计算资源和时间。即使是较小的变体,如小型语言模型(SLM),在最佳情况下也需要数天时间,往往需要多个 GPU。本文探索了在小时而非天数/周数内训练和评估基于解码器的变压器语言模型的方法。我们提出了\textit{PaPaformer},这是一种解码器变压器架构变体,其低维平行路径被组合成更大的模型。本文表明,这些低维路径可以分别使用不同类型的训练数据进行训练,然后组合成一个更大的模型。这种方法可以减少总体模型参数数量和训练时间,同时提升性能。此外,平行路径结构的使用开辟了针对特定任务需求定制化路径的有趣可能性。

关键词

引用

@article{arxiv.2508.00544,
  title  = {PaPaformer: Language Model from Pre-trained Parallel Paths},
  author = {Joonas Tapaninaho and Mourad Oussala},
  journal= {arXiv preprint arXiv:2508.00544},
  year   = {2025}
}