中文

使用训练信号生成器对抗混合的文本编码器预训练

计算与语言 2022-04-08 v1 机器学习

摘要

我们提出了一个新框架 AMOS,它通过来自多个辅助生成器的信号混合,以对抗学习课程来预训练文本编码器。遵循 ELECTRA 风格的预训练,主编码器被训练为判别器,以检测由辅助掩码语言模型(MLM)生成的替换 token。与仅训练一个 MLM 作为生成器的 ELECTRA 不同,我们联合训练多个不同大小的 MLM,以提供不同难度级别的训练信号。为了促使判别器在具有挑战性的替换 token 上学习得更好,我们通过 Gumbel-Softmax 反向传播来自判别器的梯度,学习辅助 MLM 输出上的混合权重,以最大化判别器损失。为了获得更好的预训练效率,我们提出了一种将多个 MLM 组装成一个统一辅助模型的方法。对于 BERT base 大小的模型,AMOS 在 GLUE 基准测试上比 ELECTRA 和近期最先进的预训练模型高出约 1 个点。

关键词

引用

@article{arxiv.2204.03243,
  title  = {Pretraining Text Encoders with Adversarial Mixture of Training Signal Generators},
  author = {Yu Meng and Chenyan Xiong and Payal Bajaj and Saurabh Tiwary and Paul Bennett and Jiawei Han and Xia Song},
  journal= {arXiv preprint arXiv:2204.03243},
  year   = {2022}
}

备注

ICLR 2022. (Code and Models: https://github.com/microsoft/AMOS)