语言模型从较少出现的现象中学习稀有现象:关于缺失AANN现象的案例研究
计算与语言
2025-06-26 v3
摘要
语言模型学习稀有句法现象,但归因于泛化与记忆的程度是一个主要的开放问题。为此目的,我们迭代训练transformer语言模型,方法是对人类规模大小的系统性操控语料库,然后评估其对稀有语法现象的学习:英语Article+Adjective+Numeral+Noun (AANN) construction(如"a beautiful five days")。我们将默认语料库上对该construction的学习情况与移除AANN句子的反事实语料库进行比较。我们发现,尽管进行了系统性扰动,AANN仍然比经典变体更好地被学习。通过额外的反事实语料库,我们建议这种学习是通过从相关construction(例如"a few days")进行泛化来实现的。此外,一个额外的实验显示,当输入中存在更多变异性时,这种学习将得到增强。综合上述结果,我们提供了语言模型能够通过从较少出现的现象中对稀有语法现象进行泛化的存在论证。数据与代码:https://github.com/kanishkamisra/aannalysis。
引用
@article{arxiv.2403.19827,
title = {Language Models Learn Rare Phenomena from Less Rare Phenomena: The Case of the Missing AANNs},
author = {Kanishka Misra and Kyle Mahowald},
journal= {arXiv preprint arXiv:2403.19827},
year = {2025}
}
备注
Added Corrigendum to correct 4-gram baseline performance and chance performance