用于持续学习的排他性超掩码子网络训练
计算机视觉与模式识别
2023-07-06 v2 人工智能
计算与语言
机器学习
摘要
持续学习(CL)方法致力于随时间累积知识,同时避免灾难性遗忘。最近,Wortsman 等人(2020)提出了一种 CL 方法 SupSup,它使用一个随机初始化且固定的基础网络(模型),并为每个新任务寻找一个超掩码,选择性地保留或移除每个权重以产生子网络。由于网络权重不被更新,他们避免了遗忘。尽管没有遗忘,SupSup 的性能并非最优,因为固定权重限制了其表征能力。此外,当学习新任务时,模型内部不存在知识的累积或迁移。因此,我们提出了 ExSSNeT(排他性超掩码子网络训练,Exclusive Supermask SubNEtwork Training),它执行排他且非重叠的子网络权重训练。这避免了后续任务对共享权重产生冲突更新,从而在仍防止遗忘的同时提升性能。此外,我们提出了一种新颖的基于 KNN 的知识迁移(KKT)模块,利用先前获得的知识更好更快地学习新任务。我们证明 ExSSNeT 在 NLP 和视觉领域均优于此前强大的方法,同时防止了遗忘。而且,ExSSNeT 对于激活 2-10% 模型参数的稀疏掩码尤为有利,相较 SupSup 平均提升 8.3%。此外,ExSSNeT 可扩展到大量任务(100 个)。我们的代码见 https://github.com/prateeky2806/exessnet。
引用
@article{arxiv.2210.10209,
title = {Exclusive Supermask Subnetwork Training for Continual Learning},
author = {Prateek Yadav and Mohit Bansal},
journal= {arXiv preprint arXiv:2210.10209},
year = {2023}
}
备注
ACL Findings 2023 (17 pages, 7 figures)