通过嵌入归一化改进BERT微调
计算与语言
2020-02-26 v2
摘要
像BERT这样的大型预训练句子编码器开启了自然语言处理的新篇章。将预训练BERT应用于序列分类任务(例如句子或句子对的分类)的通用做法是将[CLS]词符(在最后一层)的嵌入送入特定任务的分类层,然后联合微调BERT与分类器的模型参数。本文中,我们对多个序列分类数据集进行系统分析,以考察微调阶段前[CLS]词符的嵌入值,并提出了偏置嵌入分布问题——即[CLS]的嵌入值集中于少数维度且非零中心化。这种偏置嵌入给微调期间的优化过程带来挑战,因为[CLS]嵌入的梯度可能爆炸并导致模型性能下降。我们进一步提出了几种简单而有效的归一化方法,在微调过程中修正[CLS]嵌入。与先前做法相比,采用归一化嵌入的神经网络分类模型在多个文本分类任务上表现出提升,证明了我们方法的有效性。
引用
@article{arxiv.1911.03918,
title = {Improving BERT Fine-tuning with Embedding Normalization},
author = {Wenxuan Zhou and Junyi Du and Xiang Ren},
journal= {arXiv preprint arXiv:1911.03918},
year = {2020}
}
备注
work in progress