通过隐式结构构建提升认知启发的低数据效率语言模型性能
计算与语言
2024-03-12 v1
摘要
本文描述了我们向 BabyLM Challenge 2023 关于低数据效率语言模型(LM)预训练共享任务(Warstadt 等人,2023)的提交。我们训练了基于 transformer 的掩码语言模型,这些模型将关于层次化句子结构的无监督预测整合进模型架构中。具体而言,我们使用 Structformer 架构(Shen 等人,2021)及其变体。StructFormer 模型已被证明能在有限预训练数据上很好地完成无监督句法归纳,并取得优于标准 transformer 架构的性能(Shen 等人,2021)。在 BabyLM 挑战提供的 39 项任务上对我们模型的评估显示,将层次化偏置整合进架构的模型在某些特定任务上有望带来提升,尽管它们未能在所有任务上持续优于共享任务组织者提供的 RoBERTa 基线模型。
引用
@article{arxiv.2310.20589,
title = {Increasing The Performance of Cognitively Inspired Data-Efficient Language Models via Implicit Structure Building},
author = {Omar Momen and David Arps and Laura Kallmeyer},
journal= {arXiv preprint arXiv:2310.20589},
year = {2024}
}
备注
Accepted at the BabyLM shared task at CoNLL 2023