中文

使用低秩适配器从视觉基础模型进行混合精度超网络训练

计算机视觉与模式识别 2024-04-01 v1

摘要

将大型且性能优异的视觉基础模型(VFM)压缩为任意位宽操作(BitOPs),使其能够在各种硬件上部署。我们提出将VFM微调为混合精度量化的超网络。可以采用基于超网络的神经架构搜索(NAS)来实现这一目的,即训练一个超网络,然后可以提取出任意硬件预算内的子网络。然而,现有方法在优化混合精度搜索空间方面面临困难,并且在训练过程中会产生巨大的内存成本。为了应对这些挑战,首先,我们通过比较不同算子(如分辨率、特征大小、宽度、深度和位宽)在性能和BitOPs减少方面的表现,研究了用于微调VFM的有效搜索空间设计。其次,我们提出了使用低秩适配器(LoRA)和渐进式训练策略的内存高效超网络训练。所提出的方法在最近提出的VFM——Segment Anything Model上进行了评估,并在分割任务上进行了微调。搜索得到的模型在未造成性能下降的情况下,BitOPs减少了约95%。

关键词

引用

@article{arxiv.2403.20080,
  title  = {Mixed-precision Supernet Training from Vision Foundation Models using Low Rank Adapter},
  author = {Yuiko Sakuma and Masakazu Yoshimura and Junji Otsuka and Atsushi Irie and Takeshi Ohashi},
  journal= {arXiv preprint arXiv:2403.20080},
  year   = {2024}
}