基于Transformers的连续学习图像分类
机器学习
2022-06-29 v1 计算机视觉与模式识别
摘要
在许多现实场景中,用于训练机器学习模型的数据随时间逐步可用。然而,神经网络模型难以持续学习新概念而不遗忘过去所学内容。这一现象被称为灾难性遗忘,且由于实际约束(如可存储的数据量或可用的有限计算资源)往往难以防止。此外,从头训练大型神经网络(如Transformers)成本极高,且需要大量训练数据,而在感兴趣的应用领域中可能无法获得。近期趋势表明,基于参数扩展的动态架构能有效减少连续学习中的灾难性遗忘,但这需要复杂调优以平衡不断增长的参数数量,且几乎不在任务间共享信息。因此,它们难以扩展到大量任务而不产生显著开销。在本文中,我们在计算机视觉领域验证了近期提出的称为适配器自适应蒸馏(ADA)的方案,该方案旨在利用预训练Transformers和Adapter在文本分类任务上执行连续学习。我们在不同分类任务上的实证表明,该方法无需重新训练模型或随时间增加模型参数数量即可保持良好的预测性能。此外,与最先进的方法相比,它在推理时显著更快。
引用
@article{arxiv.2206.14085,
title = {Continual Learning with Transformers for Image Classification},
author = {Beyza Ermis and Giovanni Zappella and Martin Wistuba and Aditya Rawal and Cedric Archambeau},
journal= {arXiv preprint arXiv:2206.14085},
year = {2022}
}
备注
Appeared in CVPR CLVision workshop. arXiv admin note: substantial text overlap with arXiv:2203.04640