利用新名词性别的少样本学习探究语言模型中的语法抽象
计算与语言
2024-03-18 v1
摘要
人类能够学习一个新词并从极少的例子中推断其语法属性。他们对语法性别和一致关系等语言属性具有抽象概念,可将其应用于新的句法语境和词汇。受心理语言学启发,我们进行了一项名词学习实验,以评估 LSTM 和 decoder-only transformer 能否在法语中实现类似人类的语法性别抽象。语言模型的任务是在一个语法一致语境中从少数例子学习新名词嵌入的性别,并在另一个未见过的语境中预测一致性。我们发现,两种语言模型都能从一到两个学习样本中有效地泛化新名词性别,并在不同一致语境中应用所学性别,尽管存在对阳性性别类别的偏倚。重要的是,少样本更新仅应用于嵌入层,这表明模型在词嵌入空间内编码了足够的性别信息。尽管模型的泛化行为表明它们像人类一样将语法性别表示为一个抽象类别,但仍需进一步研究以探讨其具体实现方式。为了与人类行为进行比较,我们进行了一项类似的单样本新名词性别学习实验,结果表明,法语母语者与语言模型一样也表现出阳性性别偏倚,且同样不是优秀的单样本学习者。
引用
@article{arxiv.2403.10338,
title = {Investigating grammatical abstraction in language models using few-shot learning of novel noun gender},
author = {Priyanka Sukumaran and Conor Houghton and Nina Kazanina},
journal= {arXiv preprint arXiv:2403.10338},
year = {2024}
}
备注
EACL 2024; Findings of the Association for Computational Linguistics