中文

参数高效尚不足够:探索面向密集预测的参数、内存与时间高效适配器微调

计算机视觉与模式识别 2023-11-29 v2

摘要

预训练与微调是计算机视觉(CV)中一种普遍存在的范式。近年来,参数高效迁移学习(PETL)方法仅使用少量可训练参数便在适配下游任务时展现出有前景的性能。尽管取得了成功,现有CV中的PETL方法在计算上可能代价高昂,并在训练期间需要大量内存与时间开销,这限制了低资源用户在大模型上开展研究与应用。在本工作中,我们提出参数、内存与时间高效视觉适配器(E3VA\mathrm{E^3VA})微调以解决此问题。我们为低秩适配器提供了一条梯度反向传播高速公路,消除了通过冻结预训练模型进行昂贵反向传播的需求,从而大幅节省训练内存与训练时间。此外,我们针对CV任务优化了E3VA\mathrm{E^3VA}结构以提升模型性能。在COCO、ADE20K和Pascal VOC基准上的大量实验表明,E3VA\mathrm{E^3VA}平均可节省高达62.2%的训练内存与26.2%的训练时间,同时取得与全微调相当的性能,并优于大多数PETL方法。值得注意的是,我们甚至可以在GTX 1080Ti GPU上以少于1.5%的可训练参数训练基于Swin-Large的Cascade Mask RCNN。

关键词

引用

@article{arxiv.2306.09729,
  title  = {Parameter-efficient is not sufficient: Exploring Parameter, Memory, and Time Efficient Adapter Tuning for Dense Predictions},
  author = {Dongshuo Yin and Xueting Han and Bin Li and Hao Feng and Jing Bai},
  journal= {arXiv preprint arXiv:2306.09729},
  year   = {2023}
}

备注

14 pages, 4 figures, 5 tables, Submitted to NeurIPS2023