中文

晚期提示微调:一个晚期提示可能优于多个提示

计算与语言 2022-10-24 v2

摘要

提示微调是一种参数高效微调(PETuning)方法,用于利用预训练模型(PTMs),其简单地将软提示前置到输入并仅优化提示以适配 PTMs 到下游任务。尽管其在参数和部署上高效,其性能仍落后于其他最先进的 PETuning 方法。此外,由于通过整个模型的反向传播,提示微调的训练成本并未显著降低。通过实证分析,我们揭示了提示微调性能落后的原因,并认识到从标签信号到插入提示的传播距离与提示对模型输出的影响之间存在权衡。进一步,我们提出晚期提示微调(LPT),将晚期提示插入 PTM 的中间层而非输入层或所有层。该晚期提示由以提示插入层之前的隐藏状态为条件的神经提示生成器获得,因此是实例依赖的。通过在各种任务和 PTMs 上的广泛实验结果,我们表明 LPT 在全数据和少样本场景下均能取得与全模型微调及其他 PETuning 方法相当的性能,同时具有更快的训练速度和更低的内存开销。

关键词

引用

@article{arxiv.2210.11292,
  title  = {Late Prompt Tuning: A Late Prompt Could Be Better Than Many Prompts},
  author = {Xiangyang Liu and Tianxiang Sun and Xuanjing Huang and Xipeng Qiu},
  journal= {arXiv preprint arXiv:2210.11292},
  year   = {2022}
}

备注

Accepted by Findings of EMNLP 2022