中文

聚合、分解与微调:一种简洁而高效的视觉Transformer因子微调方法

计算机视觉与模式识别 2023-11-14 v1 人工智能 机器学习

摘要

近期进展揭示了诸如LoRA与FacT等张量化分解的参数高效微调(Parameter-Efficient Fine-Tuning)方法在视觉Transformer(ViT)中的有效性。然而,这些方法未能充分解决层内与跨层冗余问题。为应对此问题,我们提出高效因子微调(EFfective Factor-Tuning,EFFT),一种简洁而有效的微调方法。在VTAB-1K数据集上,我们的EFFT超越所有基线,以仅相当于全微调0.28%的参数取得了75.9%的top-1准确率类别平均值,达到最先进性能。鉴于EFFT的简洁与高效,其有潜力作为基础基准。代码与模型现已发布于https://github.com/Dongping-Chen/EFFT-EFfective-Factor-Tuning。

关键词

引用

@article{arxiv.2311.06749,
  title  = {Aggregate, Decompose, and Fine-Tune: A Simple Yet Effective Factor-Tuning Method for Vision Transformer},
  author = {Dongping Chen},
  journal= {arXiv preprint arXiv:2311.06749},
  year   = {2023}
}