中文

模型架构可将灾难性遗忘转化为正迁移

机器学习 2022-04-29 v3 软凝聚态物质 适应与自组织系统

摘要

McCloskey和Cohen的工作普及了灾难性干扰的概念。他们使用了一个神经网络,试图通过两组示例作为两个不同任务来学习加法。在他们的情况下,学习第二个任务迅速恶化了关于前一个任务已获取的知识。我们假设这可能是根本问题的症状:加法是一种算法任务,不应通过模式识别来学习。因此,更适于该任务的其他模型架构将避免灾难性遗忘。我们使用一种具有不同架构的神经网络,可训练以恢复二进制数加法的正确算法。该神经网络包含条件子句,这些子句在反向传播算法中自然处理。我们在McCloskey和Cohen提出的设定中测试它,并逐个对随机加法进行训练。该神经网络不仅未遭受灾难性遗忘,而且随着训练推进提升了对未见数字对的预测能力。我们还表明这是一种稳健效应,在多次模拟平均时同样存在。本工作强调了神经网络架构对于灾难性遗忘出现的重要性,并引入了一种能够学习算法的神经网络。

关键词

引用

@article{arxiv.2108.03940,
  title  = {Model architecture can transform catastrophic forgetting into positive transfer},
  author = {Miguel Ruiz-Garcia},
  journal= {arXiv preprint arXiv:2108.03940},
  year   = {2022}
}