中文

FLORA:面向视觉 Transformer 的细粒度低秩架构搜索

计算机视觉与模式识别 2023-11-08 v1 机器学习

摘要

视觉 Transformer(ViT)近来在众多计算机视觉任务中展现出成功。然而,其高昂的计算需求对实际部署提出了重大挑战。低秩近似作为降低计算负载的著名方法脱颖而出,但在 ViT 中高效自动化目标秩的选择仍具挑战。借鉴秩选择与一次性 NAS(One-Shot NAS)之间显著的相似性与一致性,我们提出 FLORA,一个基于 NAS 的端到端自动框架。为克服由庞大搜索空间带来的超网设计挑战,FLORA 采用低秩感知候选过滤策略。该方法熟练识别并剔除表现不佳的候选,有效缓解子网络间潜在的欠训练与相互干扰。为进一步提升低秩超网的质量,我们设计了低秩特定的训练范式。首先,提出权重继承以构建超网并实现低秩模块间的梯度共享。其次,采用低秩感知采样,结合预训练模型继承的信息,策略性地分配训练资源。实证结果凸显了 FLORA 的有效性。借助我们的方法,可自动生成更细粒度的秩配置,并相较简单的均匀配置实现高达 33% 的额外 FLOPs 削减。更具体地,FLORA-DeiT-B/FLORA-Swin-B 可节省高达 55%/42% 的 FLOPs 且几乎无性能下降。重要的是,FLORA 兼具通用性与正交性,与主流压缩技术或紧凑混合结构结合时可额外降低 21%–26% 的 FLOPs。我们的代码公开于 https://github.com/shadowpa0327/FLORA。

关键词

引用

@article{arxiv.2311.03912,
  title  = {FLORA: Fine-grained Low-Rank Architecture Search for Vision Transformer},
  author = {Chi-Chih Chang and Yuan-Yao Sung and Shixing Yu and Ning-Chi Huang and Diana Marculescu and Kai-Chiang Wu},
  journal= {arXiv preprint arXiv:2311.03912},
  year   = {2023}
}

备注

Accepted by WACV 2024