中文

高效语言模型预训练与下游适应的锦囊妙计:基于GLUE基准的案例研究

计算与语言 2023-02-21 v1

摘要

本技术报告简要描述了我们 JDExplore d-team 在通用语言理解评估(GLUE)排行榜上的提交系统 Vega v1,其中 GLUE 是一个包含九项自然语言理解任务的集合,包括问答、语言可接受性、情感分析、文本相似度、释义检测和自然语言推理。[方法] 我们研究了多种有效策略,并选择它们的最佳组合设置作为训练配方。在模型结构方面,我们采用带有解耦注意力的标准 Transformer 作为基本块编码器。对于自监督训练,我们在第一阶段采用代表性的去噪目标(即替换词元检测),并在第二阶段将其与对比目标(即句子嵌入对比学习)相结合。在微调过程中,采用了多种先进技术,如直推式微调、自校准微调和对抗性微调。[结果] 根据我们的提交记录(2022年1月),凭借优化的预训练和微调策略,我们13亿参数的模型在 4/9 的任务上取得了新的最优性能,实现了 91.3 的最佳平均分。令人鼓舞的是,我们的 Vega v1 是首个在两个具有挑战性的任务(即 SST-2 和 WNLI)上超越强大人类表现的模型。我们相信,我们这套经验上成功的锦囊妙计配方,可以为开发高效的判别式大语言模型提供新的思路。

关键词

引用

@article{arxiv.2302.09268,
  title  = {Bag of Tricks for Effective Language Model Pretraining and Downstream Adaptation: A Case Study on GLUE},
  author = {Qihuang Zhong and Liang Ding and Keqin Peng and Juhua Liu and Bo Du and Li Shen and Yibing Zhan and Dacheng Tao},
  journal= {arXiv preprint arXiv:2302.09268},
  year   = {2023}
}

备注

Technical report. arXiv admin note: text overlap with arXiv:2212.01853