通过自我进化实现高效语言模型预训练与下游适配:以SuperGLUE为例
计算与语言
2022-12-06 v1
摘要
本技术报告简要描述了京东探索者d团队(JDExplore d-team)在SuperGLUE排行榜上的Vega v2提交。SuperGLUE比广泛使用的通用语言理解评估(GLUE)基准更具挑战性,包含八项困难语言理解任务,包括问答、自然语言推理、词义消歧、共指消解与推理。[方法] 与任意增大预训练语言模型(PLM)规模不同,我们的目标是:1)在给定参数预算(如6B)下从输入预训练数据中充分提取知识,以及2)将该知识有效迁移至下游任务。为实现目标1),我们提出PLM的自我进化学习,以明智地预测应被掩码的信息性词元,并用修正平滑标签监督掩码语言建模(MLM)过程。对于目标2),我们利用提示迁移技术,通过将基础模型及相关下游任务的知识迁移至目标任务来改善低资源任务。[结果] 根据我们的提交记录(2022年10月),凭借优化的预训练与微调策略,我们的6B Vega方法在8项任务中的4项上取得新的最先进(SOTA)性能,于2022年10月8日位居SuperGLUE排行榜首位,平均得分91.3。
引用
@article{arxiv.2212.01853,
title = {Toward Efficient Language Model Pretraining and Downstream Adaptation via Self-Evolution: A Case Study on SuperGLUE},
author = {Qihuang Zhong and Liang Ding and Yibing Zhan and Yu Qiao and Yonggang Wen and Li Shen and Juhua Liu and Baosheng Yu and Bo Du and Yixin Chen and Xinbo Gao and Chunyan Miao and Xiaoou Tang and Dacheng Tao},
journal= {arXiv preprint arXiv:2212.01853},
year = {2022}
}
备注
Technical report