中文

优化低资源语言模型训练:多 epoch、 多语言和两阶段方法的全面分析

计算与语言 2024-10-17 v1

摘要

本文解决了针对低资源语言大语言模型(LLM)的训练设置优化问题,由于语料量有限。现有工作采用多 epoch、 多语言和两阶段训练来有效利用有限的目标语言语料。然而,仍缺乏对组合这三种方法训练 LLM 时最佳超参数设置的理解。我们全面探索了低资源语言 LLM 的训练设置,结合这三种方法,并发现以下见解用于有效降低超参数搜索成本:(1)随着目标语言语料量的减少,最佳训练方法从单语言单阶段训练转向在计算预算相关阈值处的多语言两阶段训练。(2)最佳模型规模与目标语言语料量无关,允许使用单语言训练的计算最优规模。(3)最佳 epoch 数可以从小规模实验推导出大规模模型。此外,我们提供证据表明,在单阶段训练中,目标语言验证损失对目标语言比例服从幂律分布,指数与数据量、模型规模和语言对无关。

关键词

引用

@article{arxiv.2410.12325,
  title  = {Optimizing Low-Resource Language Model Training: Comprehensive Analysis of Multi-Epoch, Multi-Lingual, and Two-Stage Approaches},
  author = {Kosuke Akimoto and Masafumi Oyamada},
  journal= {arXiv preprint arXiv:2410.12325},
  year   = {2024}
}

备注

16 pages, 10 figures