Mini Minds:探索 Bebeshka 与 Zlata 婴儿模型
计算与语言
2024-05-02 v1 人工智能
机器学习
摘要
在本文中,我们描述了里昂第二大学提交给 BabyLM 竞赛 Strict-Small 赛道的方案。该共享任务强调在有限规模数据上从头进行小规模语言建模以及人类语言习得。为 Strict-Small 赛道发布的数据集含 1000 万词,与儿童词汇量相当。我们通过架构搜索处理该任务,在共享任务数据上最小化掩码语言建模损失。找到最优配置后,我们引入了两个提交评估的小规模语言模型(LM):一个含 8 个注意力头的 4 层编码器和一个含 12 个注意力头的 6 层解码器模型,我们分别称之为 Bebeshka 和 Zlata。尽管规模仅为基线 LM 的一半,我们提出的模型取得了相当的性能。我们进一步探索了小规模语言模型在涉及道德判断任务中的适用性,使其预测与人类价值观对齐。这些发现凸显了紧凑型 LM 在解决实际语言理解任务方面的潜力。
引用
@article{arxiv.2311.03216,
title = {Mini Minds: Exploring Bebeshka and Zlata Baby Models},
author = {Irina Proskurina and Guillaume Metzler and Julien Velcin},
journal= {arXiv preprint arXiv:2311.03216},
year = {2024}
}
备注
CoNLL 2023 BabyLM Challenge