中文

微调语言模型是持续学习者

计算与语言 2022-11-01 v4

摘要

近期关于大语言模型的研究依赖于这样一种直觉:大多数自然语言处理任务可通过自然语言指令来描述。在这些指令上训练的语言模型在多个标准数据集上展现出强大的零样本性能。然而,这些模型尽管令人印象深刻,在其各自的训练与评估集之外的广泛任务上仍表现不佳。为应对此局限,我们认为模型应当能够持续扩展其知识与能力,且不遗忘既往技能。尽管持续学习(Continual Learning)成效有限,我们表明语言模型可以成为持续学习者。我们通过实证研究了这一成功的原因,并得出结论:持续学习源于自监督预训练。我们最终的模型Continual-T0(CT0)能够学习多样的新任务,同时在既往任务上保持良好性能,总计涵盖70个数据集。最后,我们展示了CT0能够以训练时从未见过的方式组合指令,表现出一定的组合性。

关键词

引用

@article{arxiv.2205.12393,
  title  = {Fine-tuned Language Models are Continual Learners},
  author = {Thomas Scialom and Tuhin Chakrabarty and Smaranda Muresan},
  journal= {arXiv preprint arXiv:2205.12393},
  year   = {2022}
}