DropDim:一种面向 Transformer 网络的正则化方法
计算与语言
2023-04-21 v1 计算机视觉与模式识别
摘要
我们提出 DropDim,一种专为正则化自注意力机制而设计的结构化 dropout 方法,自注意力是 transformer 的关键组件。与随机丢弃神经元的一般 dropout 方法不同,DropDim 丢弃部分嵌入维度。通过这种方式,语义信息可被完全丢弃。从而可以打破不同嵌入维度之间过度的协同适应,并迫使自注意力在抹去一定数量的嵌入维度的情况下编码有意义的特征。在 MUST-C 英德数据集上执行的广泛任务实验表明,DropDim 能有效提升模型性能、减少过拟合,并与其他正则化方法呈现互补效果。当与标签平滑结合时,在 ASR 任务上 WER 可从 19.1% 降至 15.1%,在 MT 任务上 BLEU 值可从 26.90 提升至 28.38。在 ST 任务上,模型可达到 22.99 的 BLEU 分数,相比强基线提升 1.86 个 BLEU 点。
引用
@article{arxiv.2304.10321,
title = {DropDim: A Regularization Method for Transformer Networks},
author = {Hao Zhang and Dan Qu and Keji Shao and Xukui Yang},
journal= {arXiv preprint arXiv:2304.10321},
year = {2023}
}