中文

持续学习器是增量式模型泛化器

机器学习 2023-06-22 v1 计算机视觉与模式识别

摘要

受预训练模型解决下游任务的高效性与快速收敛性启发,本文广泛研究了持续学习(CL)模型作为预训练器的效果。在有监督与无监督 CL 中,我们发现表示的迁移质量常逐步提升,且微调性能无明显退化。这是因为 CL 模型能在轻易遗忘任务特定知识的同时学到改进的任务通用特征。基于该观察,我们提出一种带掩码建模的新无监督 CL 框架,旨在训练期间捕获流畅的任务通用表示。此外,我们提出一种新的微调方案——全局注意力离散化(GLAD),在解决下游任务时保留丰富的任务通用表示。经 GLAD 微调的模型取得有竞争力的性能,且本身也可用作良好的预训练模型。我们认为本文打破了预训练与微调步骤间的壁垒,并导向一种可持续学习框架,其中持续学习器增量式提升模型泛化能力,从而对未见任务产生更好的迁移。

关键词

引用

@article{arxiv.2306.12026,
  title  = {Continual Learners are Incremental Model Generalizers},
  author = {Jaehong Yoon and Sung Ju Hwang and Yue Cao},
  journal= {arXiv preprint arXiv:2306.12026},
  year   = {2023}
}

备注

ICML 2023