预训练Transformer在上下文中高效学习低维目标函数
机器学习
2024-11-06 v1 机器学习
摘要
Transformer可以通过示例演示高效地进行上下文学习。大多数现有的理论分析研究了Transformer在线性函数类上的上下文学习能力,通常表明预训练损失的最小化器在最小二乘目标上实现了一步梯度下降。然而,这种简化的线性设置 arguably 并未展示上下文学习的统计效率,因为预训练Transformer在性能上并未优于直接在测试提示上求解线性回归。在本文中,我们通过具有非线性MLP层的Transformer研究了非线性函数类的上下文学习:给定一类单指标目标函数 ,其中指标特征 从一个 维子空间中抽取,我们证明通过梯度下降优化的非线性Transformer(其预训练样本复杂度取决于连接函数 的信息指数)仅需依赖于目标函数分布维度 的提示长度即可在上下文中学习 ;相比之下,任何直接在测试提示上学习 的算法所产生的统计复杂度随环境维度 缩放。我们的结果突显了预训练Transformer对函数类低维结构的适应性,使其能够实现样本高效的上下文学习,优于仅能访问上下文数据的估计器。
引用
@article{arxiv.2411.02544,
title = {Pretrained transformer efficiently learns low-dimensional target functions in-context},
author = {Kazusato Oko and Yujin Song and Taiji Suzuki and Denny Wu},
journal= {arXiv preprint arXiv:2411.02544},
year = {2024}
}
备注
NeurIPS 2024