中文

Lil-Bevo:以更类人的方式训练语言模型之策略探索

计算与语言 2026-04-17 v1

摘要

我们呈现提交给BabyLM挑战赛的Lil-Bevo。我们以三种要素预训练了掩码语言模型:先用音乐数据初始预训练,先在较短序列上训练再在较长序列上训练,以及掩码特定词元以针对部分BLiMP子任务。总体而言,我们的基线模型表现高于随机水平,但远低于在更多数据上训练的更大型LLMs的性能水平。我们发现短序列训练优于长序列训练。音乐预训练或许可边际助益性能,但即便如此效应似乎很小。我们针对性的掩码语言建模增强总体上未显改善模型性能,但似乎在我们针对的部分特定BLiMP任务上有所帮助(例如否定极性项)。以少量数据训练高性能LLMs是一项困难却具潜在信息量的任务。尽管我们的若干技术展现出些许前景,仍需更多工作来探究它们能否带来超越此处 modest 增益的性能提升。我们的代码见 https://github.com/venkatasg/Lil-Bevo,模型见 https://huggingface.co/collections/venkatasg/babylm-653591cdb66f4bf68922873a。

关键词

引用

@article{arxiv.2310.17591,
  title  = {Lil-Bevo: Explorations of Strategies for Training Language Models in More Humanlike Ways},
  author = {Venkata S Govindarajan and Juan Diego Rodriguez and Kaj Bostrom and Kyle Mahowald},
  journal= {arXiv preprint arXiv:2310.17591},
  year   = {2026}
}

备注

Proceedings of the BabyLM Challenge