魔法词是什么?大语言模型提示的控制理论
计算与语言
2024-07-08 v4 人工智能
机器学习
神经与进化计算
摘要
提示工程对于部署 LLM 至关重要,但在数学上知之甚少。我们将 LLM 系统形式化为一类离散随机动力系统,以通过控制理论的视角探究提示工程。我们对自注意力作为可控性局限的数学分析,给出了其作为参矩阵奇异函数(奇异值)的函数的表述。我们针对一组 LLM(包括 Falcon-7b、Llama-7b 和 Falcon-40b)的可控性给出了互补的实证结果。给定来自 Wikitext 的初始状态 以及长度 个词的提示,我们发现“正确”的下一个词至少 97% 的时间可达,且前 75 个最可能下一个词至少 85% 的时间可达。有趣的是,短提示序列可剧烈改变特定输出的似然,甚至使最不可能的词变为最可能的词。这种对 LLM 的控制理论分析展示了输入序列在引导输出概率中显著且未被充分理解的的作用,为增强语言模型系统能力提供了基础性视角。
引用
@article{arxiv.2310.04444,
title = {What's the Magic Word? A Control Theory of LLM Prompting},
author = {Aman Bhargava and Cameron Witkowski and Shi-Zhuo Looi and Matt Thomson},
journal= {arXiv preprint arXiv:2310.04444},
year = {2024}
}
备注
28 pages, 10 figures