中文

Prompt Tuning 在 Transformer 中的记忆限制

机器学习 2025-09-03 v1

摘要

尽管 prompt tuning 在将预训练语言模型适应到新任务方面取得了经验性成功,但其能力的理论分析仍然有限。现有的理论工作主要关注通用逼近属性,展示出与标准权重调优相当的结果。在本文中,我们探索了 Transformer 理论的一个不同方面:prompt tuning 的记忆能力。我们提供了两个主要的理论贡献。首先,我们证明了 Transformer 记忆的信息量不能快速于提示长度的线性关系。其次,而且更重要的是,我们Present了首个形式化地证明了一个在大型语言模型中经验观察到的现象:上下文长度扩展时的性能下降。我们严格地表明,Transformer 本质上具有有限的记忆,这限制了它们能够保留的信息量,无论上下文大小如何。这一发现为理解 Transformer 架构的内在局限性,特别是其处理长序列的能力,提供了根本性的理解。

关键词

引用

@article{arxiv.2509.00421,
  title  = {Memory Limitations of Prompt Tuning in Transformers},
  author = {Maxime Meyer and Mario Michelessa and Caroline Chaux and Vincent Y. F. Tan},
  journal= {arXiv preprint arXiv:2509.00421},
  year   = {2025}
}