BabyHGRN:探索 RNN 在语言模型样本高效训练中的潜力
计算与语言
2025-10-31 v1
摘要
本文探讨了循环神经网络(RNN)和其他亚二次体系结构在低资源语言建模场景中作为基于变换器模型的竞争性替代方案的潜力。我们利用 HGRN2(Qin 等,2024),这是一种最近提出的 RNN 基于体系结构,并对其有效性进行了与基于变换器的基线以及其他亚二次体系结构(LSTM、xLSTM、Mamba)的比较评估。我们的实验结果表明,BABYHGRN——我们的 HGRN2 语言模型——在挑战中 10M 和 100M 单词轨道上的性能均优于基于变换器的模型,测量指标包括 BLiMP、EWoK、GLUE 和 BEAR 基准。进一步,我们展示了知识蒸馏的积极影响。我们的发现挑战了对变换器体系结构的主导关注,表明 RNN 基于模型,特别是在资源受限环境中,具有可行性。
引用
@article{arxiv.2412.15978,
title = {BabyHGRN: Exploring RNNs for Sample-Efficient Training of Language Models},
author = {Patrick Haller and Jonas Golde and Alan Akbik},
journal= {arXiv preprint arXiv:2412.15978},
year = {2025}
}
备注
7 pages, 7 figures and tables, Published in Proceedings of the BabyLM Challenge 2025