中文

低维子空间视角下的类神经网络在-context 学习的分布外概览

机器学习 2026-04-30 v2 机器学习 统计理论 统计理论

摘要

Transformer 在执行类神经网络 (ICL) 方面展现出惊人的能力, 这引发了广泛的研究旨在理解其优势与局限性。然而, 对 ICL 能否在其预训练数据之外进行概览仍缺乏理论理解。本文提出一个最小数学模型, 可可证地识别 ICL 何时能够在分布外 (OOD) 进行概览。通过研究以低秩协方差矩阵参数化的线性回归任务, 我们将分布偏移建模为子空间间夹角的变化, 并推导出单层线性注意力模型在所有夹角上进行插值的条件。我们表明, 如果预训练任务向量来自子空间的联合体, 则 Transformer 能够概览所有夹角偏移——即使在训练分布中概率为零的区域亦可实现。另一方面, 如果预训练任务来自单个高斯分布, 则测试风险对夹角显示出显著依赖, 这表明 ICL 无法实现 OOD 概览。我们经验上表明, 我们的结果也适用于诸如 GPT-2 等模型, 并展示了我们的发现如何推广到非线性函数类。

关键词

引用

@article{arxiv.2505.14808,
  title  = {Out-of-Distribution Generalization of In-Context Learning: A Low-Dimensional Subspace Perspective},
  author = {Soo Min Kwon and Alec S. Xu and Can Yaras and Laura Balzano and Qing Qu},
  journal= {arXiv preprint arXiv:2505.14808},
  year   = {2026}
}

备注

AISTATS 2026