语言模型中复杂技能涌现的理论
机器学习
2023-11-07 v2 人工智能
计算与语言
机器学习
摘要
当今AI产品的一大驱动力在于:当语言模型的参数集和训练语料库被扩大时,新技能会在模型中涌现。该现象尚缺乏深入理解,且通过基于梯度的训练的数学分析给出机制性解释似乎十分困难。本文采取不同路径,利用著名的(且经验性的)LLM缩放定律与一个简单统计框架来分析涌现。贡献包括:(a) 一个统计框架,将LLM的交叉熵损失与语言任务背后的基础技能上的能力相关联。(b) 数学分析表明,缩放定律暗示了一种强归纳偏置,使预训练模型能非常高效地学习。我们非正式地称之为{\em slingshot泛化},因为直观来看它似乎给出了违反通常泛化理论的技能能力水平。(c) slingshot泛化的一个关键例子:涉及个技能元组的任务执行能力,基本上在与基础技能本身相同的缩放规模和相同速率下涌现。
引用
@article{arxiv.2307.15936,
title = {A Theory for Emergence of Complex Skills in Language Models},
author = {Sanjeev Arora and Anirudh Goyal},
journal= {arXiv preprint arXiv:2307.15936},
year = {2023}
}