FacT:面向视觉 Transformer 轻量适配的因子化调优
计算机视觉与模式识别
2023-06-13 v2
摘要
近期工作探索了通过仅更新少量参数来适配预训练视觉 Transformer(ViT)以提升存储效率的潜力,称为参数高效迁移学习(PETL)。当前的 PETL 方法已表明,仅调优 0.5% 的参数,ViT 便能适配下游任务,且性能甚至优于全量微调。在本文中,我们旨在进一步提升 PETL 的效率,以满足实际应用场景中极端的存储约束。为此,我们提出一种张量化分解框架来存储权重增量,其中每个 ViT 的权重被张量化为单个 3D 张量,其增量随后被分解为轻量因子。在微调过程中,仅需更新并存储这些因子,称为 Factor-Tuning(FacT,因子化调优)。在 VTAB-1K 基准上,我们的方法与最先进的 PETL 方法 NOAH 性能相当,而参数效率高出 5 倍。我们还给出了一个微小版本,仅使用 8K(ViT 参数的 0.01%)可训练参数,却优于全量微调及 VPT、BitFit 等许多其他 PETL 方法。在少样本设置下,FacT 也以最少参数击败所有 PETL 基线,展示了其在低数据 regime(体制)下的强大能力。
引用
@article{arxiv.2212.03145,
title = {FacT: Factor-Tuning for Lightweight Adaptation on Vision Transformer},
author = {Shibo Jie and Zhi-Hong Deng},
journal= {arXiv preprint arXiv:2212.03145},
year = {2023}
}
备注
AAAI 2023 Oral. Code: https://github.com/JieShibo/PETL-ViT