大语言模型的涌现能力是海市蜃楼吗?
人工智能
2023-05-23 v2 机器学习
摘要
近期有研究声称大语言模型展现出涌现能力,即较小规模模型中不存在而较大规模模型中存在的能力。涌现能力引人注目之处有二:其一是其锐利性,看似瞬间从不存在转变为存在;其二是其不可预测性,看似在无法预见的模型规模下出现。在此,我们提出对涌现能力的另一种解释:对于特定任务和模型族,在分析固定模型输出时,涌现能力的出现是由于研究者对指标的选择,而非模型行为随规模发生根本性变化。具体而言,非线性或不连续指标会产生表观的涌现能力,而线性或连续指标则会产生平滑、连续且可预测的模型性能变化。我们在一个简单数学模型中给出这一替代解释,随后以三种互补方式进行检验:我们(1)利用 InstructGPT/GPT-3 族在具有声称涌现能力的任务上,对指标选择的影响做出、检验并确认了三项预测;(2)在 BIG-Bench 涌现能力的元分析中对指标选择做出、检验并确认了两项预测;(3)展示了在多种视觉任务及不同深度网络中如何选择指标以产生此前未见的表观涌现能力。通过全部三项分析,我们提供的证据表明,所谓的涌现能力在不同指标或更好的统计量下会消散,并可能并非缩放 AI 模型的基本属性。
引用
@article{arxiv.2304.15004,
title = {Are Emergent Abilities of Large Language Models a Mirage?},
author = {Rylan Schaeffer and Brando Miranda and Sanmi Koyejo},
journal= {arXiv preprint arXiv:2304.15004},
year = {2023}
}