Elsa会怎么做?Transformer微调过程中的层冻结
计算与语言
2019-11-11 v1
摘要
基于预训练Transformer的语言模型在自然语言处理的大量任务上取得了最优性能。这些模型具有高度表达能力,至少包含一亿参数和十余层。近期证据表明,仅需在下游任务上微调最后几层即可获得高质量结果。自然地,一个后续研究问题是“我们需要微调多少最后层?”本文精确回答了该问题。我们考察了两种近期预训练语言模型BERT和RoBERTa,在文本蕴含、语义相似度、情感分析和语言可接受性等标准任务上的表现。我们改变所微调的最后层数量,进而研究任务特定效果的变化。我们表明仅需微调最后层中的四分之一即可达到原始质量的90%。令人惊讶的是,我们还发现微调所有层并非总是有益。
引用
@article{arxiv.1911.03090,
title = {What Would Elsa Do? Freezing Layers During Transformer Fine-Tuning},
author = {Jaejun Lee and Raphael Tang and Jimmy Lin},
journal= {arXiv preprint arXiv:1911.03090},
year = {2019}
}
备注
5 pages