中文

征稿启事——BabyLM挑战赛:基于发育合理语料库的样本高效预训练

计算与语言 2023-01-30 v1

摘要

我们发布 BabyLM 挑战赛的征稿启事:基于发育合理语料库的样本高效预训练。该共享任务面向对小尺度语言建模、人类语言习得、低资源 NLP 以及认知建模感兴趣的参与者。我们与 CoNLL 和 CMCL 合作,为使用受儿童输入启发、规模受限的语料库进行预训练的方法提供平台。该任务设有三个赛道,其中两个将训练数据限制为预先发布的 1000 万词和 1 亿词数据集,专门用于探索架构变体、自监督目标或课程学习等方法。最后一个赛道仅限制所用文本量,允许在数据类型、领域乃至模态上创新(即欢迎文本以外来源的数据)。我们将发布一个共享评估流程,在包括针对性句法评估和自然语言理解在内的多种基准与任务上对模型打分。

关键词

引用

@article{arxiv.2301.11796,
  title  = {Call for Papers -- The BabyLM Challenge: Sample-efficient pretraining on a developmentally plausible corpus},
  author = {Alex Warstadt and Leshem Choshen and Aaron Mueller and Adina Williams and Ethan Wilcox and Chengxu Zhuang},
  journal= {arXiv preprint arXiv:2301.11796},
  year   = {2023}
}