中文

论任务多样性下深度与循环对上下文学习的作用

机器学习 2024-10-30 v1 统计理论 机器学习 统计理论

摘要

深度 Transformer 模型引人入胜的上下文学习 (ICL) 能力近来引起了广泛关注。通过研究单模态高斯数据上的上下文线性回归,近期的实证和理论工作认为,ICL 源于 Transformer 模拟梯度下降等学习算法的能力。然而,这些工作未能刻画 Transformer 在上下文中学习多个任务的卓越能力。为此,我们研究具有多样任务的线性回归上下文学习,其特征为数据协方差矩阵的条件数范围为 [1,κ][1, \kappa],并强调在此设置下深度的重要性。更具体地,(a) 我们给出了在无限制(或受限)注意力设置下 log(κ)\log(\kappa)(或 κ\sqrt{\kappa})个线性注意力层的理论下界,以及 (b) 我们证明多层 Transformer 确实可以用与下界匹配的层数解决此类任务。然而,我们表明多层 Transformer 的这种表达能力是以鲁棒性为代价的。具体而言,多层 Transformer 甚至对 Wasserstein 距离上小至 O(eL)O(e^{-L}) 的分布偏移都不鲁棒,其中 LL 为网络深度。随后我们证明,循环 Transformer——一类具有权重共享的特殊多层 Transformer——不仅展现出类似的表达能力,而且在温和假设下可证明具有鲁棒性。除了分布外泛化之外,我们还表明循环 Transformer 是唯一表现出损失随深度单调变化行为的模型。

关键词

引用

@article{arxiv.2410.21698,
  title  = {On the Role of Depth and Looping for In-Context Learning with Task Diversity},
  author = {Khashayar Gatmiry and Nikunj Saunshi and Sashank J. Reddi and Stefanie Jegelka and Sanjiv Kumar},
  journal= {arXiv preprint arXiv:2410.21698},
  year   = {2024}
}