中文

多语言编码器与 Seq2Seq 模型顺序预训练的配方

计算与语言 2023-06-16 v1 人工智能 机器学习

摘要

预训练的仅编码器模型和序列到序列(seq2seq)模型各有优势,然而从头训练这两类模型的计算代价高昂。我们探索通过以其中一类模型初始化另一类模型来提升预训练效率的配方。(1)从 seq2seq 模型中提取编码器,我们发现其表现不如掩码语言建模(MLM)编码器,尤其在序列标注任务上。在 seq2seq 训练期间采用不同的掩码方式、缩小解码器规模,以及接续少量 MLM 训练,均未能弥合这一差距。(2)反之,使用编码器热启动 seq2seq 训练,我们表明通过在训练过程中段解冻编码器,可以使任务表现与从头训练的 seq2seq 模型持平。总体而言,这种两阶段方法是一种高效的配方,可同时获得多语言编码器和 seq2seq 模型,在匹配各自从头训练模型性能的同时,将总计算成本降低 27%。

关键词

引用

@article{arxiv.2306.08756,
  title  = {Recipes for Sequential Pre-training of Multilingual Encoder and Seq2Seq Models},
  author = {Saleh Soltan and Andy Rosenbaum and Tobias Falke and Qin Lu and Anna Rumshisky and Wael Hamza},
  journal= {arXiv preprint arXiv:2306.08756},
  year   = {2023}
}

备注

ACL Findings 2023 and SustaiNLP Workshop 2023