线性回归的上下文学习需要多少预训练任务?
机器学习
2024-03-18 v2 机器学习
摘要
在多样任务上预训练的 Transformer 展现出卓越的上下文学习(ICL)能力,使其仅基于输入上下文即可解决未见任务,而无需调整模型参数。本文中,我们研究 ICL 最简设置之一:以高斯先验对线性回归预训练线性参数化的单层线性注意力模型。我们建立了注意力模型预训练的统计任务复杂度界,表明有效预训练仅需少量独立任务。进一步,我们证明该预训练模型在固定上下文长度下对未见任务达到近贝叶斯最优风险,从而紧密匹配贝叶斯最优算法(即最优调谐的岭回归)。这些理论发现补充了先前的实验研究,并阐明了 ICL 的统计基础。
引用
@article{arxiv.2310.08391,
title = {How Many Pretraining Tasks Are Needed for In-Context Learning of Linear Regression?},
author = {Jingfeng Wu and Difan Zou and Zixiang Chen and Vladimir Braverman and Quanquan Gu and Peter L. Bartlett},
journal= {arXiv preprint arXiv:2310.08391},
year = {2024}
}
备注
ICLR 2024 Camera Ready