中文

模型生成的预训练信号提升文本到文本 Transformer 的零样本泛化能力

计算与语言 2024-03-11 v1

摘要

本文探讨了模型生成信号在提升诸如 T5 等文本到文本 Transformer 的零样本泛化能力方面的有效性。我们研究了使用辅助模型构建更具挑战性的 token 替换以供主模型去噪来预训练 T5 的多种设计。研究的关键方面包括解码目标、RTD head 的位置以及掩码模式。基于这些研究,我们开发了新模型 METRO-T0,其使用重新设计的 ELECTRA 风格预训练策略进行预训练,随后在 NLP 任务混合上进行了提示微调。METRO-T0 在提示型 NLP 基准(如 T0 Eval 和 MMLU)上优于所有相似规模的基线,并以仅 8% 的参数媲美最先进的 T0-11B 模型。我们对模型神经激活与参数敏感性的分析表明,METRO-T0 的有效性源于参数更均衡的贡献及其容量的更好利用。代码与模型检查点可在 https://github.com/gonglinyuan/metro_t0 获取。

关键词

引用

@article{arxiv.2305.12567,
  title  = {Model-Generated Pretraining Signals Improves Zero-Shot Generalization of Text-to-Text Transformers},
  author = {Linyuan Gong and Chenyan Xiong and Xiaodong Liu and Payal Bajaj and Yiqing Xie and Alvin Cheung and Jianfeng Gao and Xia Song},
  journal= {arXiv preprint arXiv:2305.12567},
  year   = {2024}
}

备注

Published as a conference paper at ACL 2023. 9 pages