面向神经语言模型的逐层正则化Dropout
计算与语言
2024-02-27 v1 人工智能
摘要
在当今流行的各种预训练神经语言模型中,dropout已是不可或缺的正则化技术。为解决dropout随机性导致的训练与推理不一致问题,一些研究在输出层使用一致性训练来正则化dropout。本文提出了一种新颖的逐层正则化Dropout(LR-Drop),专为基于Transformer的语言模型设计。具体而言,LR-Drop利用一致性训练策略逐层正则化每个Transformer层。每个训练样本通过dropout采样的两个孪生子模型,然后LR-Drop强制这两个孪生子模型的隐藏状态、多头注意力矩阵和输出分布保持一致。所提出的LR-Drop可视为一种“自蒸馏”框架,其中dropout生成的每个子模型互为对方的“教师”模型和“学生”模型。通过在8个自然语言理解数据集、6个神经机器翻译数据集和1个抽象摘要数据集(共15个数据集)上的大量实验,我们展示了LR-Drop取得了优越的性能,包括最先进的结果。
引用
@article{arxiv.2402.16361,
title = {Layer-wise Regularized Dropout for Neural Language Models},
author = {Shiwen Ni and Min Yang and Ruifeng Xu and Chengming Li and Xiping Hu},
journal= {arXiv preprint arXiv:2402.16361},
year = {2024}
}