中文

超越记忆:使用短语构式评估大型语言模型中的语义泛化

计算与语言 2025-08-14 v2 人工智能

摘要

预训练数据的网络规模造成了一个重要的评估挑战:如何将预训练数据中充分代表的案例上的语言能力与对域外语言(特别是预训练数据中较少出现的动态真实世界实例)的泛化区分开来。为此,我们利用构式语法(CxG)构建了一个诊断性评估,以系统评估 LLM 的自然语言理解。CxG 为测试泛化提供了一个心理语言学上合理的框架,因为它明确地将句法形式与抽象的、非词汇的意义联系起来。我们的新颖推理评估数据集包含英语短语构式,已知说话者能够从常见实例中抽象出来,以理解和产生创造性实例。我们的评估数据集使用 CxG 来评估两个核心问题:第一,模型是否能“理解”那些在预训练数据中可能较少出现、但对人类来说直观且易于理解的句子的语义;第二,LLM 能否在句法相同但意义不同的构式之间部署适当的构式语义。我们的结果表明,包括 GPT-o1 在内的最先进模型在我们的第二个任务上性能下降了超过 40%,揭示了它们无法像人类那样在句法相同的形式上进行泛化以得出不同的构式意义。我们将公开我们的新颖数据集以及相关的实验数据,包括提示和模型响应。

关键词

引用

@article{arxiv.2501.04661,
  title  = {Beyond Memorization: Assessing Semantic Generalization in Large Language Models Using Phrasal Constructions},
  author = {Wesley Scivetti and Melissa Torgbi and Austin Blodgett and Mollie Shichman and Taylor Hudson and Claire Bonial and Harish Tayyar Madabushi},
  journal= {arXiv preprint arXiv:2501.04661},
  year   = {2025}
}