课程学习结合发育数据对语法习得的影响
计算与语言
2023-11-06 v2
摘要
本研究探讨语法习得在多大程度上由语言“简单性”与数据的源模态(语音 vs. 文本)所驱动。以 BabyBERTa 为探针,我们发现语法习得主要由对语音数据的接触驱动,尤其是通过接触 BabyLM 训练语料中的 AO-Childes 与 Open Subtitles 两个语料。我们通过考察向模型输入数据的多种呈现方式得出该发现。首先,我们评估基于多种序列级复杂度的课程之影响。接着我们考察以“块”为单位学习的影响——覆盖各源语料中按 token 数(而非行数)均衡的文本跨度。最后,我们探索使模型接触不同语料程度各异的课程。所有情形下,我们发现对 AO-Childes 与 Open Subtitles 的过度接触显著驱动了性能。我们通过一个可比的控制数据集验证了这些发现,该数据集中对这些语料及更广义语音的接触被人为限制。我们的结果表明,助益习得的并非高效用数据所占 token 比例,而是分配给此类数据的训练步比例。我们希望这能鼓励未来研究使用更具发育合理性的语言数据(往往更稀缺)来增强通用预训练方案。
引用
@article{arxiv.2311.00128,
title = {On the effect of curriculum learning with developmental data for grammar acquisition},
author = {Mattia Opper and J. Morrison and N. Siddharth},
journal= {arXiv preprint arXiv:2311.00128},
year = {2023}
}
备注
CoNLL-CMCL Shared Task BabyLM Challenge 2023