中文

免训练 Transformer 架构搜索

计算机视觉与模式识别 2022-03-24 v1

摘要

近来,视觉 Transformer(ViT)在若干计算机视觉任务中取得了显著成功。这些进展与架构设计高度相关,因此提出 Transformer 架构搜索(TAS)以自动搜索更优 ViT 是值得的。然而,当前 TAS 方法耗时较长,且我们根据实验观察发现,CNN 中现有的零成本代理在 ViT 搜索空间中泛化不佳。本文中,我们首次探究如何以免训练方式进行 TAS,并设计了一种有效的免训练 TAS(TF-TAS)方案。首先,我们观察到 ViT 中多头自注意力(MSA)与多层感知机(MLP)的性质差异明显,且 MSA 的突触多样性对性能影响显著。其次,基于该观察,我们在 TF-TAS 中采用模块化策略,从突触多样性与突触显著性或两个理论视角评估并排序 ViT 架构,称为 DSS-indicator。借助 DSS-indicator,评估结果与原 ViT 模型的测试精度强相关。实验结果表明,我们的 TF-TAS 取得了与最先进的手动或自动设计 ViT 架构相竞争的性能,且大幅提升了 ViT 搜索空间中的搜索效率:从约 2424 GPU 天降至少于 0.50.5 GPU 天。此外,所提 DSS-indicator 优于现有的前沿零成本方法(如 TE-score 与 NASWOT)。

关键词

引用

@article{arxiv.2203.12217,
  title  = {Training-free Transformer Architecture Search},
  author = {Qinqin Zhou and Kekai Sheng and Xiawu Zheng and Ke Li and Xing Sun and Yonghong Tian and Jie Chen and Rongrong Ji},
  journal= {arXiv preprint arXiv:2203.12217},
  year   = {2022}
}

备注

Accepted to CVPR 2022