大语言模型涌现能力背后的U型与倒U型比例效应
人工智能
2025-02-13 v2 计算与语言
摘要
大型语言模型(LLMs)在某些下游任务中表现出涌现能力,其中模型性能最初停滞,然后在规模超过阈值后出现尖锐且不可预测的提升。本文通过按难度级别对问题进行分组来探讨这一现象,并提供一种可能的解释。具体而言,我们观察到难问题呈U型比例效应,而易问题呈倒U型比例效应后再稳步提升。两种比例模式最初相互抵消,导致整体性能停滞。当易问题的比例模式从逆向转为标准比例时,性能开始迅速提升,从而引发涌现能力。基于这一发现,我们提出一种简单而有效的管道,称为 Slice-and-Sandwich,用于预测涌现阈值以及阈值后的模型性能。我们的代码已在 https://github.com/tony10101105/ExpEmergence 上公开 availble。
引用
@article{arxiv.2410.01692,
title = {U-shaped and Inverted-U Scaling behind Emergent Abilities of Large Language Models},
author = {Tung-Yu Wu and Pei-Yu Lo},
journal= {arXiv preprint arXiv:2410.01692},
year = {2025}
}
备注
accepted to ICLR 2025