中文

BabyBabelLM:一份具有发展心理学合理性的多语言训练数据基准

计算与语言 2025-10-14 v1

摘要

我们提出 BabyBabelLM,一个多语言数据集集合,用于建模一个人从出生到习得母语期间所接触到的语言。我们精心整理了具有发展心理学合理性的预训练数据,旨在为 45 种语言中的每一种提供相当于 1 亿英语单词的内容。我们为每种语言编制了评估套件并训练了基线模型。BabyBabelLM 旨在促进多语言预训练与认知建模研究。

关键词

引用

@article{arxiv.2510.10159,
  title  = {BabyBabelLM: A Multilingual Benchmark of Developmentally Plausible Training Data},
  author = {Jaap Jumelet and Abdellah Fourtassi and Akari Haga and Bastian Bunzeck and Bhargav Shandilya and Diana Galvan-Sosa and Faiz Ghifari Haznitrama and Francesca Padovani and Francois Meyer and Hai Hu and Julen Etxaniz and Laurent Prévot and Linyang He and María Grandury and Mila Marcheva and Negar Foroutan and Nikitas Theodoropoulos and Pouya Sadeghi and Siyuan Song and Suchir Salhan and Susana Zhou and Yurii Paniv and Ziyin Zhang and Arianna Bisazza and Alex Warstadt and Leshem Choshen},
  journal= {arXiv preprint arXiv:2510.10159},
  year   = {2025}
}