中文

眨眼之间:生成模型中特征定位的简单理论

机器学习 2025-06-06 v2

摘要

大语言模型可以在眨眼之间表现出意想不到的行为。在最近的一次计算机使用演示中,一个语言模型从编码切换到搜索黄石公园的图片,这种行为的突然转变也在推理模式和越狱中被观察到。这种现象并非自回归模型所独有:在扩散模型中,最终输出的关键特征是在生成过程的狭窄“关键窗口”中决定的。在这项工作中,我们利用随机定位采样器的形式化,发展了一个简单、统一的理论来解释这一现象。我们表明,当生成过程定位到其建模分布的一个子群体时,这种现象会普遍出现。虽然关键窗口在扩散模型中已被广泛研究,但现有理论严重依赖于强分布假设和高斯扩散的特殊性。与现有工作相比,我们的理论(1)适用于自回归和扩散模型;(2)不做任何分布假设;(3)即使在专门用于扩散时,也能在数量上改进先前的界限;(4)只需要基本工具,不需要随机微积分或基于统计物理的机制。我们还发现了与统计推断中“全有或全无”现象的一个有趣联系。最后,我们通过实验验证了我们对LLM的预测,并发现关键窗口通常与各种数学和推理基准测试中问题解决的失败同时发生。

关键词

引用

@article{arxiv.2502.00921,
  title  = {Blink of an eye: a simple theory for feature localization in generative models},
  author = {Marvin Li and Aayush Karan and Sitan Chen},
  journal= {arXiv preprint arXiv:2502.00921},
  year   = {2025}
}