BPDec:揭示掩码语言建模解码器在 BERT 预训练中的潜力
计算与语言
2024-12-11 v4 人工智能
摘要
BERT(Bidirectional Encoder Representations from Transformers)凭借其在众多任务上的卓越表现,彻底改变了自然语言处理领域。然而,大多数研究人员主要集中于与模型结构相关的改进,例如相对位置嵌入和更高效的注意力机制。另一些人则深入研究了与掩码语言建模相关的预训练技巧,包括全词掩码。DeBERTa 引入了一种适用于 BERT 编码器模型的增强解码器进行预训练,并被证明非常有效。我们认为,围绕增强掩码语言建模解码器的设计与研究一直未得到应有的重视。在本文中,我们提出了几种增强解码器的设计,并介绍了 BPDec(BERT Pretraining Decoder),一种新颖的模型训练方法。通常,预训练的 BERT 模型会针对特定的自然语言理解(NLU)任务进行微调。在我们的方法中,我们使用原始的 BERT 模型作为编码器,仅更改解码器而不改变编码器。这种方法不需要对编码器架构进行大量修改,并且可以无缝集成到现有的微调流程和服务中,提供了一种高效的增强策略。与其他方法相比,尽管我们在预训练过程中也为解码器产生了一定的训练成本,但我们的方法在微调阶段不会引入额外的训练成本。我们在预训练后测试了多种增强解码器结构,并评估了它们在 GLUE 任务和 SQuAD 任务上的性能。结果表明,BPDec 仅在预训练期间对模型结构进行了微妙的改进,便在不增加微调成本、推理时间和服务预算的情况下显著提升了模型性能。
引用
@article{arxiv.2401.15861,
title = {BPDec: Unveiling the Potential of Masked Language Modeling Decoder in BERT pretraining},
author = {Wen Liang and Youzhi Liang},
journal= {arXiv preprint arXiv:2401.15861},
year = {2024}
}