DyTox:用于动态令牌扩展持续学习的Transformer
计算机视觉与模式识别
2022-08-09 v3 机器学习
摘要
深度网络架构难以在不遗忘先前任务的情况下持续学习新任务。近期趋势表明,基于参数扩展的动态架构可有效减少持续学习中的灾难性遗忘。然而,现有方法常需在测试时提供任务标识符,需要复杂调参以平衡不断增长的参数量,且几乎不在任务间共享信息。因此,它们难以扩展到大量任务而不产生显著开销。本文提出一种基于专用编码器/解码器框架的Transformer架构。关键在于,编码器和解码器在所有任务间共享。通过特殊令牌的动态扩展,我们将解码器网络的每次前向传播专用于某一任务分布。我们的策略可扩展到大量任务,同时由于对参数扩展的严格控制,带来可忽略的内存与时间开销。此外,该高效策略无需任何超参数调优来控制网络扩展。我们的模型在CIFAR100上取得优异结果,并在大规模ImageNet100和ImageNet1000上达到最先进性能,同时参数量少于同期动态框架。
引用
@article{arxiv.2111.11326,
title = {DyTox: Transformers for Continual Learning with DYnamic TOken eXpansion},
author = {Arthur Douillard and Alexandre Ramé and Guillaume Couairon and Matthieu Cord},
journal= {arXiv preprint arXiv:2111.11326},
year = {2022}
}
备注
CVPR 2022, Code at https://github.com/arthurdouillard/dytox