提示预训练 Transformer 可作为通用近似器
机器学习
2024-02-23 v1 人工智能
泛函分析
摘要
尽管提示 (prompting)、提示调优 (prompt tuning) 和前缀调优 (prefix-tuning) 在 Transformer 模型中被广泛采用,但我们对这些微调方法的理论理解仍然有限。一个关键问题是:是否可以通过提示或前缀调优任意修改预训练模型的行为。形式上,即提示和前缀调优预训练模型是否能通用近似序列到序列的函数。本文给出了肯定的回答,并表明比先前认为更小的预训练模型在前缀化时可以成为通用近似器。事实上,注意力机制 uniquely suited 用于通用近似,仅需前缀化单个注意力头即可近似任何连续函数。此外,任何序列到序列的函数都可以通过前缀化一个深度与序列长度成线性关系的 Transformer 来近似。除了这些稠密性类型的结果外,我们还提供了 Jackson 型界限,用于估算以所需精度近似函数所需的前缀长度。
引用
@article{arxiv.2402.14753,
title = {Prompting a Pretrained Transformer Can Be a Universal Approximator},
author = {Aleksandar Petrov and Philip H. S. Torr and Adel Bibi},
journal= {arXiv preprint arXiv:2402.14753},
year = {2024}
}