婴儿语言模型挑战的最新发现:在发育合理语料库上的样本高效预训练
计算与语言
2025-04-14 v1
摘要
儿童可以通过少于一亿词的输入来获得语言能力。大型语言模型的数据效率远不如人类:它们通常需要数据量大约高出三到四个数量级,仍无法在许多评估任务中达到人类的表现。这些资源密集型需求限制了研究者训练新模型的能力,并限制了将现有模型用作发育合理认知模型的潜力。婴儿语言模型挑战是一个集体性努力,参与者竞争在固定数据预算下优化语言模型训练。提交的模型将在针对语法能力、下游任务性能和泛化能力的各种评估任务中进行比较。参赛者可提交最多三个赛道,数据限制条件逐步放宽。从超过30个提交中,我们提炼出训练数据高效语言模型的具体建议,以及未来应(或不应)聚焦的方向。获得 LTG-BERT 架构(Samuel 等,2023)获胜提交方案的模型,在训练数据量上超过数万亿词,展现了卓越表现。其他提交方案通过训练较短输入序列或以预训练教师模型训练学生模型等方式取得了强劲结果。教育学习尝试占据了大量提交方案,虽然整体上未取得成功,但仍有一些表现出适度的改进。
引用
@article{arxiv.2504.08165,
title = {Findings of the BabyLM Challenge: Sample-Efficient Pretraining on Developmentally Plausible Corpora},
author = {Alex Warstadt and Aaron Mueller and Leshem Choshen and Ethan Wilcox and Chengxu Zhuang and Juan Ciro and Rafael Mosquera and Bhargavi Paranjape and Adina Williams and Tal Linzen and Ryan Cotterell},
journal= {arXiv preprint arXiv:2504.08165},
year = {2025}
}
备注
Published in Proceedings of BabyLM. Please cite the published version on ACL anthology: http://aclanthology.org/2023.conll-babylm.1/