TLM:面向 Transformer 的令牌级掩码
计算与语言
2023-10-31 v1 机器学习
摘要
结构化 dropout 方法,如注意力 dropout 和 DropHead,已被研究用于正则化 Transformer 中的多头注意力机制。本文中,我们提出一种基于令牌级而非结构级的新正则化方案以减少过拟合。具体而言,我们为 Transformer 设计了一种新颖的令牌级掩码(TLM)训练策略来正则化自注意力的连接,其包含两种有效且易于实现的掩码技术。基本思想是通过掩码操纵多头注意力中令牌之间的连接,迫使网络利用部分邻居信息产生有意义的表示。TLM 的通用性与有效性通过在 18 个数据集上的 4 项多样化 NLP 任务(包括自然语言理解基准 GLUE、ChineseGLUE、中文语法纠错以及数据到文本生成)的大量实验得到充分评估。结果表明 TLM 能持续优于注意力 dropout 和 DropHead,例如,在 GLUE 上相较使用 BERT-large 的 DropHead 相对提升 0.5 个点。此外,TLM 能在数据到文本基准 Rotowire(18.93 BLEU)上创下新纪录。我们的代码将公开于 https://github.com/Young1993/tlm。
关键词
引用
@article{arxiv.2310.18738,
title = {TLM: Token-Level Masking for Transformers},
author = {Yangjun Wu and Kebin Fang and Dongxiang Zhang and Han Wang and Hao Zhang and Gang Chen},
journal= {arXiv preprint arXiv:2310.18738},
year = {2023}
}
备注
13 pages. Accepted by EMNLP2023 main conference