中文

过多信息:让 BabyLM 的训练保持简单

计算与语言 2023-11-06 v1

摘要

本文详述了格罗宁根大学在 BabyLM 挑战赛中的工作。我们遵循这样一种理念:如同婴儿,语言模型应首先接触更简单的概念,并基于这些知识构建以理解更复杂的概念。我们通过多种视角来检验这种由简至繁的策略,即上下文长度、词汇表以及数据的总体语言复杂度。我们发现只有一种——上下文长度——真正有益于语言模型的训练。然而这一对上下文长度的简单改动使我们在 (Super)GLUE 任务上平均提升 2 个点,在 MSGS 任务上提升 1 个点,在 BLiMP 任务上平均提升 12%。我们限制上下文的模型优于在 10×\times 数据量上训练的基线。

关键词

引用

@article{arxiv.2311.01955,
  title  = {Too Much Information: Keeping Training Simple for BabyLMs},
  author = {Lukas Edman and Lisa Bylinina},
  journal= {arXiv preprint arXiv:2311.01955},
  year   = {2023}
}