中文

BabyLM挑战:探索变体集对语言模型训练效率的影响

计算与语言 2025-03-20 v2

摘要

尽管当前大型语言模型取得了显著成功,但其数据效率仍是一个亟待解决的挑战。最近有研究建议,儿童导向语言(CDS)可以提高基于Transformer神经网络的现代语言模型的训练数据效率。然而,尚不清楚CDS的哪些具体特性对训练这些模型有效。在BabyLM挑战的背景下,我们关注变体集(VSs),即表达相似意图但措辞和结构略有不同的连续话语集合,这在CDS中普遍存在。为了评估VSs对训练数据效率的影响,我们用不同比例的人工VSs增强CDS数据,并使用这些数据集训练自回归模型GPT-2。我们发现,最佳VSs比例取决于评估基准:BLiMP和GLUE分数从VSs的存在中受益,但EWOK分数则不然。此外,结果还因多种因素而异,如训练轮数和话语呈现顺序。综上所述,这些发现表明VSs对语言模型可能有积极影响,但仍有进一步研究的空间。

关键词

引用

@article{arxiv.2411.09587,
  title  = {BabyLM Challenge: Exploring the Effect of Variation Sets on Language Model Training Efficiency},
  author = {Akari Haga and Akiyo Fukatsu and Miyu Oba and Arianna Bisazza and Yohei Oseki},
  journal= {arXiv preprint arXiv:2411.09587},
  year   = {2025}
}

备注

Accepted by BabyLM challenge 2024 at CONLL 2024 ( https://aclanthology.org/2024.conll-babylm.23 )