中文

将预训练语言模型作为多视角课程学习者

计算与语言 2023-05-09 v1

摘要

ELECTRA 这一生成器-判别器预训练框架,已在各类下游任务中展现出令人印象深刻的语义构建能力。尽管性能令人信服,ELECTRA 仍面临训练单调与交互不足的挑战。仅采用掩码语言建模(MLM)的生成器会导致判别器有偏学习与标签不平衡,降低学习效率;判别器到生成器无显式反馈回路,造成两组件间鸿沟,未充分利用课程学习。本研究提出多视角课程学习(MCL)方法,以获取多维度与多视觉角度实现样本高效预训练,并充分利用生成器与判别器间关系。具体而言,设计三门自监督课程以缓解 MLM 固有缺陷并从多视角平衡标签;此外提出两门自纠正课程,通过创建“纠正笔记”实现二次监督,弥合两编码器间鸿沟。进而开展课程汤(course soups)试验以解决 MCL 的“拔河”动态问题,演化出更强的预训练模型。实验结果表明,我们的方法在 GLUE 与 SQuAD 2.0 基准上分别显著提升 ELECTRA 平均性能 2.8% 与 3.2% 绝对点,并在相同设置下超越近期先进 ELECTRA 风格模型。预训练 MCL 模型发布于 https://huggingface.co/McmanusChen/MCL-base。

关键词

引用

@article{arxiv.2305.03981,
  title  = {Pre-training Language Model as a Multi-perspective Course Learner},
  author = {Beiduo Chen and Shaohan Huang and Zihan Zhang and Wu Guo and Zhenhua Ling and Haizhen Huang and Furu Wei and Weiwei Deng and Qi Zhang},
  journal= {arXiv preprint arXiv:2305.03981},
  year   = {2023}
}

备注

Accepted as Findings of ACL 2023