中文

使用类人发育数据语料库预训练大语言模型

计算与语言 2024-01-11 v4 人工智能

摘要

预训练大语言模型(LLMs)已在多种语言推理与理解任务中展现出成功。LLM的预训练阶段会观察大量原始文本数据语料。BabyLM共享任务将LLM预训练与人类语言习得进行比较,其中13岁儿童所见的token数量远小于LLM所见的token数量。在本工作中,我们使用大致与儿童所见相同数量的token来预训练并评估LLM学习上下文词表示的能力。我们提供了一组强基线;包含不同架构、跨训练轮次性能变化的评估,以及针对该任务的strict small和strict赛道所报告的预训练指标。我们还尝试松散地复现任务组织者给出的RoBERTa基线,以观察训练对超参数选择的鲁棒性及可复现性。我们在本报告中提供了向strict和strict-small赛道提交的具体细节。

关键词

引用

@article{arxiv.2311.04666,
  title  = {Pre-training LLMs using human-like development data corpus},
  author = {Khushi Bhardwaj and Raj Sanjay Shah and Sashank Varma},
  journal= {arXiv preprint arXiv:2311.04666},
  year   = {2024}
}

备注

Proceedings of the BabyLM Challenge at the 27th Conference on Computational Natural Language Learning