中文

生成式预训练变换器的相干波动力学与语言生成

计算与语言 2023-05-10 v1 斑图形成与孤子

摘要

大语言模型(LLMs),如生成式预训练变换器(GPT),已在各种语言任务中取得巨大成功,但其涌现能力也引发了诸多需要解决的疑问、担忧与挑战。为更好地理解模型内部机制,我们分析了一个小型 GPT 中的隐藏状态与通道波动力学,聚焦于跨通道相关性和个体自相关方面的波模式相干性。我们的发现表明,波动力学提供了一致且可重复的内在振荡模式,以及在语言生成中具有上下文感知的可塑性与表现力。通过分析波模式、相干性与聚类,我们提供了一种识别并解释隐藏状态通道功能的系统方法,为理解并控制高层语言模式形成铺平道路。此外,我们研究了文本序列生成中拼写错误的泊松统计在不同模型训练程度下的表现,并观察到类相变过程。随着相干性建立,正确词与错拼词的生成之间存在竞争。然而,一旦模型得到充分训练且显著相干性浮现,相干过程变得足够强以有效抑制拼写错误,防止缺陷的级联放大。正确拼写的分布从泊松型转变为亚泊松型,而错拼分布呈现相反趋势。通过借助量子物理的概念与技术,我们获得了对小型 GPT 动力学的新颖见解。该方法可扩展至展现更复杂相干语言模式的更大语言模型,为解释其涌现能力并开发更专门的模型开辟机遇。

关键词

引用

@article{arxiv.2305.05061,
  title  = {Coherent Wave Dynamics and Language Generation of a Generative Pre-trained Transformer},
  author = {Tao Hong},
  journal= {arXiv preprint arXiv:2305.05061},
  year   = {2023}
}

备注

10 pages, 7 figures for conference publication