派生形态学揭示大型语言模型中的类比泛化
计算与语言
2024-11-13 v1 人工智能
机器学习
摘要
大型语言模型(LLM)中语言泛化的潜在机制是什么?这个问题引起了广泛关注,大多数研究分析了LLM语言技能在多大程度上类似于规则。迄今为止,尚不清楚LLM中的语言泛化是否同样可以解释为类比过程的结果,该过程可以形式化为对存储范例的相似性操作。先前研究的一个关键缺陷是侧重于高度规则性的语言现象,对于这些现象,基于规则和类比的方法做出相同的预测。在这里,我们转而研究派生形态学,特别是英语形容词名词化,它表现出显著的变异性。我们引入了一种研究LLM中语言泛化的新方法:以GPT-J为重点,我们将实例化基于规则和类比学习的认知模型拟合到LLM训练数据,并将其对一组新造形容词的预测与LLM的预测进行比较,从而能够直接得出关于潜在机制的结论。正如预期,对于具有规则名词化模式的形容词,基于规则和类比的模型同样能很好地解释GPT-J的预测。然而,对于具有可变名词化模式的形容词,类比模型提供了更好的匹配。此外,GPT-J的行为对单个词频敏感,即使对于规则形式也是如此,这种行为与规则形式的类比解释一致,但与基于规则的解释不一致。这些发现反驳了GPT-J在形容词名词化上的语言泛化涉及规则的假设,表明对存储范例的相似性操作是潜在机制。总体而言,我们的研究表明,类比过程在LLM的语言泛化中扮演的角色比先前认为的更大。
引用
@article{arxiv.2411.07990,
title = {Derivational Morphology Reveals Analogical Generalization in Large Language Models},
author = {Valentin Hofmann and Leonie Weissweiler and David Mortensen and Hinrich Schütze and Janet Pierrehumbert},
journal= {arXiv preprint arXiv:2411.07990},
year = {2024}
}