中文

大语言模型涌现能力背后的U型与倒U型比例效应

人工智能 2025-02-13 v2 计算与语言

摘要

大型语言模型(LLMs)在某些下游任务中表现出涌现能力,其中模型性能最初停滞,然后在规模超过阈值后出现尖锐且不可预测的提升。本文通过按难度级别对问题进行分组来探讨这一现象,并提供一种可能的解释。具体而言,我们观察到难问题呈U型比例效应,而易问题呈倒U型比例效应后再稳步提升。两种比例模式最初相互抵消,导致整体性能停滞。当易问题的比例模式从逆向转为标准比例时,性能开始迅速提升,从而引发涌现能力。基于这一发现,我们提出一种简单而有效的管道,称为 Slice-and-Sandwich,用于预测涌现阈值以及阈值后的模型性能。我们的代码已在 https://github.com/tony10101105/ExpEmergence 上公开 availble。

关键词

引用

@article{arxiv.2410.01692,
  title  = {U-shaped and Inverted-U Scaling behind Emergent Abilities of Large Language Models},
  author = {Tung-Yu Wu and Pei-Yu Lo},
  journal= {arXiv preprint arXiv:2410.01692},
  year   = {2025}
}

备注

accepted to ICLR 2025