中文

每层都有价值的语言模型训练中的惊讶度预测器

计算与语言 2024-12-05 v1

摘要

主动课程语言建模(Active Curriculum Language Modeling, ACLM;Hong 等,2023)是一种以学习者为导向的语言模型训练方法。我们在本次 BabyLM 2023 任务的初步提交中提出了该过程的原始版本,现为 BabyLM 2024 任务提出更新后的 ACLM 流程。ACLM 通过模型化不确定性,在训练过程中动态构建课程,优先处理与最不确定的训练项相似度高的其他训练项。我们改进的过程使相似度模型更具动态性,并在 BabyLM 2023 任务中取得成功的最佳模型 ELC-BERT(Charpentier 和 Samuel,2023)上运行 ACLM。我们发现,尽管模型在细粒度语法推断方面表现不足,但在常识和世界知识任务上超越了 BabyLM 2024 官方基线。我们将代码公开于 https: //github.com/asayeed/ActiveBaby。

关键词

引用

@article{arxiv.2412.03098,
  title  = {A surprisal oracle for when every layer counts},
  author = {Xudong Hong and Sharid Loáiciga and Asad Sayeed},
  journal= {arXiv preprint arXiv:2412.03098},
  year   = {2024}
}