中文

SpacTor-T5:结合 Span Corruption 与替换词元检测的 T5 模型预训练

机器学习 2024-01-25 v1 计算与语言

摘要

众所周知,预训练大型语言模型极其消耗资源,且往往效率低下,未能充分利用训练文本序列中包含的信息。在本文中,我们提出了 SpacTor,一种新的训练程序,包括 (1) 结合 span corruption (SC) 和 token replacement detection (RTD) 的混合目标,以及 (2) 两阶段课程学习,在最初的 τ\tau 次迭代中优化该混合目标,然后过渡到标准的 SC 损失。我们通过经验表明,混合目标的有效性与两阶段预训练调度密切相关,并对此进行了深入分析以解释其原因。在编码器-解码器架构(T5)上的多种 NLP 任务实验中,SpacTor-T5 获得了与标准 SC 预训练相同的下游性能,同时使预训练迭代次数减少了 50%,总 FLOPs 减少了 40%。或者,在给定相同计算预算的情况下,我们发现 SpacTor 显著提高了下游基准测试性能。

关键词

引用

@article{arxiv.2401.13160,
  title  = {SpacTor-T5: Pre-training T5 Models with Span Corruption and Replaced Token Detection},
  author = {Ke Ye and Heinrich Jiang and Afshin Rostamizadeh and Ayan Chakrabarti and Giulia DeSalvo and Jean-François Kagy and Lazaros Karydas and Gui Citovsky and Sanjiv Kumar},
  journal= {arXiv preprint arXiv:2401.13160},
  year   = {2024}
}

备注

9+13 pages, 5 figures