ToddlerBERTa:利用 BabyBERTa 进行语法学习与语言理解
计算与语言
2023-11-09 v2 机器学习
摘要
我们提出 ToddlerBERTa,一个类 BabyBERTa 的语言模型,通过五个具有不同超参数的模型探究其能力。在 BLiMP、SuperGLUE、MSGS 以及 BabyLM 挑战赛的一个补充基准上评估,我们发现较小的模型可在特定任务中表现出色,而较大的模型在大量数据下表现良好。尽管在较小的数据集上训练,ToddlerBERTa 展现出值得称道的性能,可与最先进的 RoBERTa-base 相媲美。该模型展现出稳健的语言理解能力,即便仅使用单句预训练,也能与利用更宽泛上下文信息的基线相竞争。我们的工作为超参数选择和数据利用提供了见解,推动了语言模型的发展。
引用
@article{arxiv.2308.16336,
title = {ToddlerBERTa: Exploiting BabyBERTa for Grammar Learning and Language Understanding},
author = {Omer Veysel Cagatan},
journal= {arXiv preprint arXiv:2308.16336},
year = {2023}
}
备注
CoNLL--CMCL 2023 Shared Task: The BabyLM Challenge, Camera-Ready Version