叠加中的超掩码
机器学习
2020-10-23 v3 人工智能
机器学习
摘要
我们提出叠加中的超掩码(SupSup)模型,能够顺序学习数千个任务而不会发生灾难性遗忘。我们的方法使用一个随机初始化且固定的基网络,并为每个任务寻找一个表现良好的子网络(超掩码)。如果在测试时给定任务标识,则可以用最小的内存占用检索到正确的子网络。如果未提供,SupSup 可以使用基于梯度的优化来推断任务,寻找一个已学习超掩码的线性叠加以最小化输出熵。在实践中我们发现,即使在 2500 个任务中,单步梯度更新通常也足以识别正确的掩码。我们还展示了两个有前景的扩展。首先,SupSup 模型可以完全在没有任务标识信息的情况下训练,因为它们可以检测到对新数据不确定时为新训练分布分配额外的超掩码。最后,整个不断增长的超掩码集合可以通过将其隐式存储为固定大小 Hopfield 网络中的吸引子,而存储在恒定大小的存储池中。
引用
@article{arxiv.2006.14769,
title = {Supermasks in Superposition},
author = {Mitchell Wortsman and Vivek Ramanujan and Rosanne Liu and Aniruddha Kembhavi and Mohammad Rastegari and Jason Yosinski and Ali Farhadi},
journal= {arXiv preprint arXiv:2006.14769},
year = {2020}
}
备注
NeurIPS 2020 Camera Ready