中文

METRO:利用模型生成信号高效去噪预训练大规模自编码语言模型

机器学习 2022-04-19 v2 人工智能 计算与语言

摘要

我们提出一种利用辅助模型生成的训练信号来预训练大规模自编码语言模型的高效方法。该训练策略源于 ELECTRA,已展现出以数亿参数规模预训练模型的样本效率。本工作中,我们开展了全面的实证研究,并提出一套方案,即“模型生成去噪训练目标”(METRO),其融合了近期若干最佳建模技术,以在不损害模型效能的前提下加速、稳定并增强预训练语言模型。所得模型 METRO-LM 参数规模达 54 亿,在 GLUE、SuperGLUE 与 SQuAD 基准上取得新的最优结果。更重要的是,METRO-LM 具有高效性:常以显著更小的模型规模与更低的预训练成本优于以往大模型。

关键词

引用

@article{arxiv.2204.06644,
  title  = {METRO: Efficient Denoising Pretraining of Large Scale Autoencoding Language Models with Model Generated Signals},
  author = {Payal Bajaj and Chenyan Xiong and Guolin Ke and Xiaodong Liu and Di He and Saurabh Tiwary and Tie-Yan Liu and Paul Bennett and Xia Song and Jianfeng Gao},
  journal= {arXiv preprint arXiv:2204.06644},
  year   = {2022}
}

备注

Update details in scaled initialization and add acknowledgement