中文

神经语言模型的语法学习轨迹

计算与语言 2022-04-07 v3 人工智能 机器学习

摘要

人类语言现象的学习轨迹提供了对语言表征的洞察,超越了仅通过检查成人说话者行为所能获得的认知。为了应用类似的方法来分析神经语言模型(NLM),首先有必要确定不同模型在它们所做出的泛化上足够相似。在本文中,我们表明具有不同初始化、架构和训练数据的NLM以相似的顺序习得语言现象,尽管它们的最终性能不同。这些发现表明,存在一些共同的归纳偏置支撑着这些模型对语言现象的学习。受心理语言学的启发,我们认为研究这种归纳偏置是研究NLM中隐含的语言表征的机会。利用这些发现,我们将不同现象在不同学习阶段相对于更简单的参考模型的性能进行了比较。结果表明NLM展现出一致的“发展”阶段。此外,我们发现学习轨迹近似是一维的:给定一个具有特定整体性能的NLM,可以预测它已经习得了哪些语言泛化。对这些阶段的初步分析呈现出现象簇(尤其是形态学现象),其性能同步进展,暗示了它们背后的泛化之间潜在的联系。

关键词

引用

@article{arxiv.2109.06096,
  title  = {The Grammar-Learning Trajectories of Neural Language Models},
  author = {Leshem Choshen and Guy Hacohen and Daphna Weinshall and Omri Abend},
  journal= {arXiv preprint arXiv:2109.06096},
  year   = {2022}
}

备注

ACL camera-ready