中文

基于知识蒸馏的任务注意力Transformer架构用于视觉-语言任务的持续学习

机器学习 2023-03-28 v1

摘要

微调大规模预训练神经网络的计算量和计算负载正成为在许多应用中采用机器学习的两大障碍。持续学习(CL)能够通过在顺序到达的任务之间实现知识迁移来作为一种补救方法,从而放宽了从头微调所有网络权重的需要。然而,现有的CL算法主要考虑学习单模态仅视觉或仅语言任务。我们开发了一种基于Transformer的CL架构,用于学习双模态视觉-语言任务,其基础是动态增加可学习参数的数量并使用知识蒸馏。新增的额外参数用于使网络针对每个任务专门化。我们的方法能够在任务之间共享信息,同时应对灾难性遗忘的挑战。我们的方法可扩展到大量任务的学习,因为它仅需很少的内存和时间开销。我们的模型在具有挑战性的视觉-语言任务上达到了最先进的性能。

关键词

引用

@article{arxiv.2303.14423,
  title  = {Task-Attentive Transformer Architecture for Continual Learning of Vision-and-Language Tasks Using Knowledge Distillation},
  author = {Yuliang Cai and Jesse Thomason and Mohammad Rostami},
  journal= {arXiv preprint arXiv:2303.14423},
  year   = {2023}
}