利用混合池化网络与 Drop Mask 改进 BERT
计算与语言
2023-07-17 v1
摘要
基于 Transformer 的预训练语言模型,如 BERT,在各种自然语言理解任务中取得巨大成功。先前研究发现 BERT 在不同层捕获了丰富的语言信息层次。然而,原始 BERT 对每一层使用相同的自注意力机制来建模不同的上下文特征。在本文中,我们提出 HybridBERT 模型,其结合自注意力与池化网络以在每一层编码不同的上下文特征。此外,我们提出一种简单的 DropMask 方法,以解决在掩码语言建模预训练期间因过度使用特殊掩码 token 而导致的预训练与微调之间的不匹配。实验表明,HybridBERT 在预训练中优于 BERT,具有更低的损失、更快的训练速度(相对 8%)和更低的内存开销(相对 13%),并且在迁移学习中下游任务上相对准确率高出 1.5%。此外,DropMask 在不同掩码率下提升了 BERT 在下游任务上的准确率。
引用
@article{arxiv.2307.07258,
title = {Improving BERT with Hybrid Pooling Network and Drop Mask},
author = {Qian Chen and Wen Wang and Qinglin Zhang and Chong Deng and Ma Yukun and Siqi Zheng},
journal= {arXiv preprint arXiv:2307.07258},
year = {2023}
}
备注
7 pages, 2 figures