中文

[征稿启事] 第二届BabyLM挑战赛:基于发展合理语料库的样本高效预训练

计算与语言 2024-07-30 v2

摘要

继去年成功的BabyLM挑战赛之后,该竞赛将于2024/2025年再次举办。挑战赛的总体目标保持不变;然而,部分竞赛规则将有所调整。今年竞赛的重大变化如下:首先,我们用论文赛道取代了自由赛道,允许(例如)非基于模型的投稿、新颖的认知启发基准或分析技术。其次,我们放宽了关于预训练数据的规则,现在允许参与者在不超过1亿词或1000万词预算的前提下自行构建数据集。第三,我们引入了多模态视觉与语言赛道,并将发布一个包含50%纯文本和50%图像-文本多模态数据的语料库,作为语言模型训练的起点。本征稿启事的目的是提供今年挑战赛的规则,详细解释这些规则变化及其理由,给出今年竞赛的时间表,并回答去年挑战赛中常见的问题。

关键词

引用

@article{arxiv.2404.06214,
  title  = {[Call for Papers] The 2nd BabyLM Challenge: Sample-efficient pretraining on a developmentally plausible corpus},
  author = {Leshem Choshen and Ryan Cotterell and Michael Y. Hu and Tal Linzen and Aaron Mueller and Candace Ross and Alex Warstadt and Ethan Wilcox and Adina Williams and Chengxu Zhuang},
  journal= {arXiv preprint arXiv:2404.06214},
  year   = {2024}
}