中文

Gemma2 的全参数持续预训练:对流利度和领域知识的洞察

计算与语言 2025-06-06 v2 人工智能 机器学习

摘要

在本技术报告中,我们实证研究了大语言模型(LLM)持续学习背景下语言流利度与领域知识之间的关系。具体来说,我们通过在 CulturaX 数据集立陶宛语部分的前 10\% 上对其完整参数集进行自回归预训练,来增强 Gemma2 大语言模型的立陶宛语语言流利度。为防止模型现有领域知识发生灾难性遗忘,我们应用了弹性权重巩固(EWC),利用基于大规模多任务语言理解(MMLU)基准数据估计的费雪信息。在训练后评估中,我们通过困惑度评估语言流利度,并使用一系列语言理解基准(包括 ARC-Easy、Belebele、GSM8K、HellaSwag、MMLU、TruthfulQA 和 Winogrande)在英语和立陶宛语上的准确率来评估领域知识。实证结果表明,EWC 不仅通过保持模型在语言流利度和领域知识方面的性能来减轻灾难性遗忘,而且还改善或维持了这些针对新加入的立陶宛语的能力。这些发现突显了在无需访问原始训练数据的情况下,将通用大语言模型更高效地适配到代表性不足语言的潜力。随附的代码库已在 https://github.com/Neurotechnology/LLM_EWC 上公开。

关键词

引用

@article{arxiv.2505.05946,
  title  = {Full-Parameter Continual Pretraining of Gemma2: Insights into Fluency and Domain Knowledge},
  author = {Vytenis Šliogeris and Povilas Daniušis and Artūras Nakvosas},
  journal= {arXiv preprint arXiv:2505.05946},
  year   = {2025}
}

备注

9 pages, 3 figures, 1 table