Prompt Tuning Transformer 的根本限制:普遍性、容量与效率
机器学习
2025-06-09 v2 人工智能
计算与语言
机器学习
摘要
我们研究了针对基于转换器的基础模型进行 prompt tuning 的统计与计算限制。我们的主要贡献是对仅包含单个自注意力层的单-head 转换器进行 prompt tuning:(i) 它是普遍的,且 (ii) 在强指数时间假设(Strong Exponential Time Hypothesis, SETH) 下支持高效(甚接近线性时间)算法。从统计学角度,我们证明了针对此类最简单可能的转换器进行 prompt tuning 是序列到序列 Lipschitz 函数的通用逼近器。此外,我们提供了一个指数级下界(关于 以及 ),用于衡量 prompt tuning 记忆任意数据集所需的软 prompt 标记数量。从计算角度来看,我们确定了 prompt tuning 效率之间的相位转变,这由软 prompt 诱导的 key 和 query 的范数决定,并提供了一个上界准则。超过此准则后,在 SETH 的假设下,不存在次二次(高效)的 prompt tuning 算法。在此准则内,我们通过证明几乎线性时间的 prompt tuning 推理算法的存在来展示了我们的理论。这些根本限制为设计具有表达性和效率的 prompt tuning 方法提供了重要的必要条件。
关键词
引用
@article{arxiv.2411.16525,
title = {Fundamental Limits of Prompt Tuning Transformers: Universality, Capacity and Efficiency},
author = {Jerry Yao-Chieh Hu and Wei-Po Wang and Ammar Gilani and Chenyang Li and Zhao Song and Han Liu},
journal= {arXiv preprint arXiv:2411.16525},
year = {2025}
}
备注
Accepted at ICLR 2025. v2 matches the camera-ready version