中文

通过测试时神经网络聚合的迁移学习

机器学习 2022-06-28 v1 人工智能 计算机视觉与模式识别

摘要

已有研究表明深度神经网络优于传统机器学习。然而,深度网络缺乏泛化性,即由于域偏移,其在取自不同分布的新的(测试)集上表现不如预期。为解决这一已知问题,已有若干迁移学习方法被提出,将已训练模型的知识迁移至另一模型以在不同数据上提升性能。然而,这类方法大多需要额外的训练步骤,或面临灾难性遗忘——即已训练模型覆盖先前所学知识时发生。我们通过一种使用网络聚合的新颖迁移学习方法解决上述两个问题。我们在统一框架中训练特定于数据集的网络与一个聚合网络。损失函数包含两个主要部分:任务特定损失(如交叉熵)与聚合损失。所提聚合损失使我们的模型能够学习如何通过聚合算子聚合已训练深度网络参数。我们证明所提方法在测试时学习模型聚合而无需任何进一步训练步骤,将迁移学习的负担简化为简单的算术运算。所提方法取得了与基线相当的绩效。此外,若聚合算子存在逆,我们将展示我们的模型还天然支持选择性遗忘,即聚合模型可遗忘其训练所用的某个数据集,同时保留其他数据集上的信息。

关键词

引用

@article{arxiv.2206.13399,
  title  = {Transfer Learning via Test-Time Neural Networks Aggregation},
  author = {Bruno Casella and Alessio Barbaro Chisari and Sebastiano Battiato and Mario Valerio Giuffrida},
  journal= {arXiv preprint arXiv:2206.13399},
  year   = {2022}
}

备注

8 pages