中文

大语言模型中的通用响应与归纳行为涌现

机器学习 2024-11-12 v1 人工智能 计算与语言

摘要

虽然归纳被认为是大语言模型上下文学习的关键机制,但超越玩具模型理解其精确的电路分解仍然困难。本文通过探测大语言模型对残差流弱单 token 扰动的响应,研究归纳行为在大语言模型中的涌现。我们发现大语言模型表现出一种稳健的通用机制,其响应在扰动强度变化下保持尺度不变,从而使我们能够量化模型中 token 相关性的构建过程。应用该方法,我们在 Gemma-2-2B、Llama-3.2-3B 和 GPT-2-XL 的残差流中观察到归纳行为的特征。在所有模型中,这些归纳特征逐渐在中间层涌现,并确定了构成该行为的相关模型部分。我们的结果揭示了大语言模型内部组件的集体相互作用,并为大规模电路分析提供了基准。

关键词

引用

@article{arxiv.2411.07071,
  title  = {Universal Response and Emergence of Induction in LLMs},
  author = {Niclas Luick},
  journal= {arXiv preprint arXiv:2411.07071},
  year   = {2024}
}

备注

14 pages, 5 figures