提示微调的普适性与局限性
机器学习
2023-11-17 v2 计算与语言
摘要
尽管提示微调在适配预训练语言模型至新任务上已展现出经验有效性,但关于“在输入前调整参数”与“调整模型权重”之间差异的理论基础仍很有限。因此我们迈出理解基于transformer架构的软提示微调作用的第一步。通过考虑一个通用架构,我们从普适逼近和对连续值函数的有限深度固定权重预训练transformer的局限性两个视角分析提示微调。我们的普适性结果保证了存在一个带提示的强transformer,可逼近Lipschitz函数集中的任意序列到序列函数。有限深度transformer提示微调的局限性首先通过构造一组数据集来证明,对于给定的单个编码器层,任何长度的提示都无法记住这些数据集。我们还给出了所需可调提示参数数量的下界,并将该结果与单层设定下低秩更新(基于LoRA)所需参数数量进行比较。我们最后将分析扩展到多层设定,提供了transformer至多只能从可逆函数学习数据集的充分条件。我们的理论断言也得到了实证结果的支持。
引用
@article{arxiv.2305.18787,
title = {Universality and Limitations of Prompt Tuning},
author = {Yihan Wang and Jatin Chauhan and Wei Wang and Cho-Jui Hsieh},
journal= {arXiv preprint arXiv:2305.18787},
year = {2023}
}