中文

通过元学习为预训练语言模型构建多重训练目标

计算与语言 2022-10-20 v1

摘要

多重预训练目标弥补了单一目标语言建模在理解能力上的不足,这服务于预训练语言模型(PrLMs)的最终目的,即在大量场景下良好泛化。然而,在单一模型中学习多个训练目标具有挑战性,因为各目标间相对重要性未知且可能存在对立。实证研究表明,当前在临时手动设置下的目标采样使得所学语言表示几乎无法收敛至期望最优值。因此,我们提出 MOMETAS,一种基于元学习的新型自适应采样器,它学习任意预训练目标上的潜在采样模式。该设计轻量,额外训练开销可忽略。为验证我们的方法,我们采用五个目标并使用 BERT-base 与 BERT-large 模型进行持续预训练,其中 MOMETAS 在 14 项自然语言处理任务上相对于其他基于规则的采样策略展现出普遍的性能提升。

关键词

引用

@article{arxiv.2210.10293,
  title  = {Forging Multiple Training Objectives for Pre-trained Language Models via Meta-Learning},
  author = {Hongqiu Wu and Ruixue Ding and Hai Zhao and Boli Chen and Pengjun Xie and Fei Huang and Min Zhang},
  journal= {arXiv preprint arXiv:2210.10293},
  year   = {2022}
}

备注

EMNLP 2022 (findings)