过多信息:让 BabyLM 的训练保持简单
计算与语言
2023-11-06 v1
摘要
本文详述了格罗宁根大学在 BabyLM 挑战赛中的工作。我们遵循这样一种理念:如同婴儿,语言模型应首先接触更简单的概念,并基于这些知识构建以理解更复杂的概念。我们通过多种视角来检验这种由简至繁的策略,即上下文长度、词汇表以及数据的总体语言复杂度。我们发现只有一种——上下文长度——真正有益于语言模型的训练。然而这一对上下文长度的简单改动使我们在 (Super)GLUE 任务上平均提升 2 个点,在 MSGS 任务上提升 1 个点,在 BLiMP 任务上平均提升 12%。我们限制上下文的模型优于在 10 数据量上训练的基线。
引用
@article{arxiv.2311.01955,
title = {Too Much Information: Keeping Training Simple for BabyLMs},
author = {Lukas Edman and Lisa Bylinina},
journal= {arXiv preprint arXiv:2311.01955},
year = {2023}
}