中文

预训练语言模型为何有助于下游任务?头部调优与提示调优的分析

机器学习 2022-04-22 v2 机器学习

摘要

预训练语言模型在适配到下游 NLP 任务时已取得最优性能。然而,由于预训练与下游任务可能差异很大,对这些模型的理论分析很少且具挑战性。我们提出一个分析框架,用文本的基础隐变量生成模型将预训练与下游任务联系起来——下游分类器必须恢复隐变量后验分布的一个函数。我们在该设定下分析头部调优(在冻结的预训练模型之上学习分类器)与提示调优。我们分析中的生成模型要么是隐马尔可夫模型(HMM),要么是由自然语言中长期依赖所驱动的、增广了隐记忆组件的 HMM。我们表明:1)在 HMM 的某些非退化条件下,简单分类头即可解决下游任务;2)提示调优在更弱的非退化条件下获得下游保证;3)我们对记忆增广 HMM 的恢复保证强于普通 HMM,因为任务相关信息更易从长期记忆中恢复。在 HMM 合成生成数据上的实验支持了我们的理论发现。

关键词

引用

@article{arxiv.2106.09226,
  title  = {Why Do Pretrained Language Models Help in Downstream Tasks? An Analysis of Head and Prompt Tuning},
  author = {Colin Wei and Sang Michael Xie and Tengyu Ma},
  journal= {arXiv preprint arXiv:2106.09226},
  year   = {2022}
}