中文

Transformer 的最优 in-context 适应性与分布鲁棒性

机器学习 2026-05-08 v3 机器学习 统计理论 统计理论

摘要

我们研究 in-context 学习问题,其中 Transformer 是在来自混合分布 π=αAλαπα\pi=\sum_{\alpha\in\mathcal{A}} \lambda_{\alpha} \pi_{\alpha} 的任务中预训练的,称为预训练先验,其中每个混合组件 πα\pi_{\alpha} 是特定难度级别索引为 α\alpha 的任务分布。我们的目标是理解在测试分布 μ\mu 上评估的预训练 Transformer 的性能,后者由固定难度 βA\beta\in\mathcal{A} 的任务组成,并可能相对于 πβ\pi_\beta 存在分布偏移,受卡方散度 χ2(μ,πβ)\chi^2(\mu,\pi_{\beta}) 限制在 κ\kappa 以内。特别是,我们考虑具有随机光滑性的非参数回归问题,以及既有随机光滑性又有随机有效维度的多指数模型。我们证明,大规模 Transformer 在充足数据上预训练后,可在卡方散度球内的所有测试分布 μ\mu 上实现对应难度级别 β\beta 的最优收敛率。因此,预训练的 Transformer 在更容易的任务上可实现更快的收敛速度,并且在测试时对分布偏移具有鲁棒性。最后,我们证明即使估计器获得测试分布 μ\mu 的访问权限,其期望风险的收敛速率也不能快于我们的预训练 Transformer,从而提供了比 Minimax 下界更合适的优化保证。

关键词

引用

@article{arxiv.2510.23254,
  title  = {Optimal In-context Adaptivity and Distributional Robustness of Transformers},
  author = {Tianyi Ma and Tengyao Wang and Richard J. Samworth},
  journal= {arXiv preprint arXiv:2510.23254},
  year   = {2026}
}

备注

47 pages, 4 figures