梯度下降在原型线性回归中的有限样本分析与泛化误差界
统计理论
2024-05-13 v2 数值分析
数值分析
概率论
统计理论
摘要
最近的研究表明,基于Transformer的架构在前向传播过程中模拟梯度下降,具有原语学习(in-context learning)能力——即模型能够根据提示示例序列而无需显式训练或微调来适应新任务。本文考察在原型线性回归中,对梯度下降的单步进行泛化分析。考虑随机设计情形,推导了在非渐近(有限样本)情形下,泛化误差的统计性质与界限。这些表达式值得注意,因为它们避免了任意常数,提供了稳健的定量信息和尺度关系。结果与经典最小二乘回归进行了对比(也推导了类似的有限样本界限),阐明了系统性误差分量、噪声分量以及最优步长。此外,作为分析副产品,还介绍了高阶高斯随机矩阵乘积的恒等式。
引用
@article{arxiv.2405.02462,
title = {Finite Sample Analysis and Bounds of Generalization Error of Gradient Descent in In-Context Linear Regression},
author = {Karthik Duraisamy},
journal= {arXiv preprint arXiv:2405.02462},
year = {2024}
}