第二届 BabyLM 挑战赛结果:开发可理解语料库上的样本高效预训练
计算与语言
2024-12-09 v1
摘要
BabyLM 挑战赛是一项社区合作 efforts 以缩小人类与计算语言学习者之间的数据效率差距。参赛者在固定的 10 亿词以下语言数据预算下竞赛,以优化语言模型训练。今年,我们发布了改进的文本语料库,以及面向认知可理解的视觉-语言语料库,以促进研究认知可理解的视觉-语言模型。各提交作品在针对语法能力、(视觉)问答、语用能力及 grounding 等能力的评估任务上进行比较。参赛者可提交 1000 万词文本专属轨道、1 亿词文本专属轨道及/或 1 亿词及图像多模态轨道。来自 31 项提交的方案采用多样化方法,其中混合因果-掩码语言模型架构表现优于其他方法。多模态轨道中没有任何提交方案超越基线。在后续分析中,我们发现训练 FLOPs 与各任务平均绩效之间存在强烈关联,表现最好的提交方案提出了对训练数据的修改、训练目标以及模型架构的变更。今年的 BabyLM 挑战显示,在该设置下仍有显著的创新空间,尤其是图像-文本建模方面,但社区驱动的研究可为小规模语言建模的有效策略提供可操作性见解。
关键词
引用
@article{arxiv.2412.05149,
title = {Findings of the Second BabyLM Challenge: Sample-Efficient Pretraining on Developmentally Plausible Corpora},
author = {Michael Y. Hu and Aaron Mueller and Candace Ross and Adina Williams and Tal Linzen and Chengxu Zhuang and Ryan Cotterell and Leshem Choshen and Alex Warstadt and Ethan Gotlieb Wilcox},
journal= {arXiv preprint arXiv:2412.05149},
year = {2024}
}