时间、内存与参数高效的视觉适配
计算机视觉与模式识别
2024-02-06 v1 机器学习
摘要
随着基础模型日益普及,针对下游任务对其进行高效微调的需求也在增长。尽管已提出多种适配方法,但它们的设计仅关注训练参数的数量效率。然而,这些方法通常仍需要在整个模型中反向传播梯度,这意味着其训练时间和内存成本并未显著降低。我们提出了一种不通过主干网络反向传播梯度的适配方法。我们通过设计一个轻量级并行网络来实现这一点,该网络作用于冻结的预训练主干网络提取的特征。因此,我们的方法不仅在参数方面高效,在训练时间和内存使用方面也同样高效。我们的方法在流行的 VTAB 基准测试中实现了最先进的准确率 - 参数权衡,并且我们进一步展示了我们在训练时间和内存使用方面如何优于 prior works。我们还通过适配一个拥有 40 亿参数的视觉 Transformer 主干网络来处理计算要求极高的视频分类任务,展示了我们方法的训练效率和可扩展性,且无需复杂的模型并行。在此任务中,我们优于先前仅能扩展至 10 亿参数主干网络的基于适配器的方法,或在相同 GPU 和更少训练时间下优于对较小主干网络的全量微调。
引用
@article{arxiv.2402.02887,
title = {Time-, Memory- and Parameter-Efficient Visual Adaptation},
author = {Otniel-Bogdan Mercea and Alexey Gritsenko and Cordelia Schmid and Anurag Arnab},
journal= {arXiv preprint arXiv:2402.02887},
year = {2024}
}