中文

防止持续学习新自然语言任务时的灾难性遗忘

计算与语言 2023-02-23 v1 人工智能 机器学习

摘要

多任务学习(MTL)在自然语言处理中被广泛接受为在一个模型中学习多个相关任务的标准技术。训练一个 MTL 模型要求所有任务的训练数据同时可用。由于系统通常随时间演化(例如,为支持新功能),向已有 MTL 模型添加一个新任务通常需要从头在所有任务上重新训练模型,这可能耗时且计算昂贵。此外,在某些场景下,用于训练原始模型的数据可能不再可用,例如由于存储或隐私顾虑。在本文中,我们通过将已在 n 个任务上训练好的模型的知识蒸馏到一个用于求解 n+1 个任务的新模型中,来处理随时间增量扩展 MTL 模型求解新任务能力的问题。为避免灾难性遗忘,我们提议利用来自旧任务相同分布的未标注数据。我们在公开可用基准上的实验表明,该技术通过保留已习得的知识(即防止旧任务上高达 20% 的性能下降)同时在增量添加的任务上获得良好性能,极大地有益于蒸馏。进一步,我们还通过使用来自一个领先语音助手的数据,表明我们的方法在实际设置中亦有益。

关键词

引用

@article{arxiv.2302.11074,
  title  = {Preventing Catastrophic Forgetting in Continual Learning of New Natural Language Tasks},
  author = {Sudipta Kar and Giuseppe Castellucci and Simone Filice and Shervin Malmasi and Oleg Rokhlenko},
  journal= {arXiv preprint arXiv:2302.11074},
  year   = {2023}
}

备注

KDD 2022