中文

$DA^3$:面向内存高效端侧多域学习的动态加性注意力适配

计算机视觉与模式识别 2021-10-07 v3

摘要

如今,深度神经网络(DNN)的一个实际局限是其对单一任务或域(例如一个视觉域)的高度专门化。这促使研究者开发能够按顺序将 DNN 模型适配到多个域、同时在过往域上仍表现良好的算法,即所谓的多域学习。几乎所有传统方法仅关注以最小参数更新提升精度,而忽视了训练期间的高计算与内存开销,这使得难以将多域部署到日益广泛使用的资源受限边缘设备(如手机、物联网、嵌入式系统等)上。我们观察到,用于激活存储的大内存是极大限制边缘设备上训练时间与开销的瓶颈。为降低训练内存占用同时保持域适配精度性能,我们提出动态加性注意力适配(DA3DA^3),一种新颖的内存高效端侧多域学习方法。DA3DA^3 学习一种新颖的加性注意力适配器模块,同时为每个域冻结预训练骨干模型的权重。与先前工作不同,该模块不仅缓解激活内存缓冲以降低训练期间的内存使用,还作为动态门控机制减少推理的计算开销。我们在多个数据集上针对最先进的方法验证了 DA3DA^3,显示出在精度和训练时间上的大幅提升。此外,我们将 DA3DA^3 部署到流行的 NVIDIA Jetson Nano 边缘 GPU 上,实测实验结果表明,与基线方法(如标准微调、并行与串行残差适配器、Piggyback)相比,我们提出的 DA3DA^3 将端侧训练内存消耗降低 19-37 倍,训练时间降低 2 倍。

关键词

引用

@article{arxiv.2012.01362,
  title  = {$DA^3$:Dynamic Additive Attention Adaption for Memory-EfficientOn-Device Multi-Domain Learning},
  author = {Li Yang and Adnan Siraj Rakin and Deliang Fan},
  journal= {arXiv preprint arXiv:2012.01362},
  year   = {2021}
}

备注

8 pages