中文

大型语言模型的泛化复杂度量化

计算与语言 2024-10-04 v2

摘要

虽然大型语言模型(LLMs)在理解复杂查询和执行复杂任务方面显示出卓越的能力,但其泛化能力往往深深地与记忆能力交织在一起, necessitating 更精确的评估。为此,我们引入 Scylla,一个动态评估框架,用于量化大型语言模型的泛化能力。Scylla 通过在20个跨越5个复杂度水平的任务上,对模型在分布内(ID)和分布外(OOD)数据上的表现进行评估来将泛化与记忆分离。通过大量实验,我们发现任务复杂度与 ID 和 OOD 数据之间性能差距之间存在非单调关系,称为泛化谷。具体而言,这一现象揭示了一个关键阈值——称为关键复杂度——在此处,非可泛化行为的依赖达到峰值,表明大型语言模型泛化能力的上限。随着模型大小的增加,关键复杂度向更高的任务复杂度水平移动,这表明更大的模型可以在更复杂的推理任务上发挥作用,才能在依赖记忆之前达到其泛化能力的上限。利用 Scylla 和关键复杂度的概念,我们对28个大型语言模型进行了基准测试,包括开源模型如 LLaMA 和 Qwen 家族,以及闭源模型如 Claude 和 GPT,提供了更稳健的评估,并更清晰地理解了大型语言模型的泛化能力。

关键词

引用

@article{arxiv.2410.01769,
  title  = {Quantifying Generalization Complexity for Large Language Models},
  author = {Zhenting Qi and Hongyin Luo and Xuliang Huang and Zhuokai Zhao and Yibo Jiang and Xiangjun Fan and Himabindu Lakkaraju and James Glass},
  journal= {arXiv preprint arXiv:2410.01769},
  year   = {2024}
}