掩码更多且更晚:通过解耦 [MASK] 令牌高效预训练掩码语言模型
计算与语言
2022-11-16 v2 人工智能
摘要
掩码语言模型(MLM)的预训练消耗大量计算以在下游 NLP 任务上取得良好结果,导致巨大的碳足迹。在原始 MLM 中,虚拟令牌 [MASK] 充当占位符,并从非掩码令牌收集上下文信息以恢复损坏的信息。这引发了一个问题:我们是否可以在更晚的层追加 [MASK],以减少前几层的序列长度并使预训练更高效。我们表明:(1)[MASK] 确实可以在更晚的层追加,与词嵌入解耦;(2)从非掩码令牌收集上下文信息可用少数层完成。通过进一步将掩码率从 15% 提高到 50%,我们可以仅以原始计算预算的 78% 和 68% 从零预训练 RoBERTa-base 和 RoBERTa-large,而在 GLUE 基准上无任何性能下降。当以原始预算预训练时,我们的方法在 8 项 GLUE 任务中的 6 项上优于 RoBERTa,平均高出 0.4%。
引用
@article{arxiv.2211.04898,
title = {Mask More and Mask Later: Efficient Pre-training of Masked Language Models by Disentangling the [MASK] Token},
author = {Baohao Liao and David Thulke and Sanjika Hewavitharana and Hermann Ney and Christof Monz},
journal= {arXiv preprint arXiv:2211.04898},
year = {2022}
}
备注
Code available at: https://github.com/BaohaoLiao/3ml