Transformer 的最优 in-context 适应性与分布鲁棒性
机器学习
2026-05-08 v3 机器学习
统计理论
统计理论
摘要
我们研究 in-context 学习问题,其中 Transformer 是在来自混合分布 的任务中预训练的,称为预训练先验,其中每个混合组件 是特定难度级别索引为 的任务分布。我们的目标是理解在测试分布 上评估的预训练 Transformer 的性能,后者由固定难度 的任务组成,并可能相对于 存在分布偏移,受卡方散度 限制在 以内。特别是,我们考虑具有随机光滑性的非参数回归问题,以及既有随机光滑性又有随机有效维度的多指数模型。我们证明,大规模 Transformer 在充足数据上预训练后,可在卡方散度球内的所有测试分布 上实现对应难度级别 的最优收敛率。因此,预训练的 Transformer 在更容易的任务上可实现更快的收敛速度,并且在测试时对分布偏移具有鲁棒性。最后,我们证明即使估计器获得测试分布 的访问权限,其期望风险的收敛速率也不能快于我们的预训练 Transformer,从而提供了比 Minimax 下界更合适的优化保证。
引用
@article{arxiv.2510.23254,
title = {Optimal In-context Adaptivity and Distributional Robustness of Transformers},
author = {Tianyi Ma and Tengyao Wang and Richard J. Samworth},
journal= {arXiv preprint arXiv:2510.23254},
year = {2026}
}
备注
47 pages, 4 figures