Auto-Prox:基于自动代理发现的免训练 Vision Transformer 架构搜索
计算机视觉与模式识别
2023-12-15 v1
摘要
Vision Transformer (ViT) 在计算机视觉任务中的巨大成功很大程度上归功于架构设计。这凸显了通过高效的架构搜索自动设计更优 ViT 的必要性。由于基于训练的架构搜索方法计算量大,人们对使用零成本代理对 ViT 进行评分的免训练方法越来越感兴趣。然而,现有的免训练方法需要专家知识来手动设计特定的零成本代理。此外,这些零成本代理在不同领域间的泛化能力存在局限。在本文中,我们引入了 Auto-Prox,一个自动代理发现框架,来解决这一问题。首先,我们构建了 ViT-Bench-101,其中包含不同的 ViT 候选模型及其在多个数据集上的实际性能。利用 ViT-Bench-101,我们可以根据零成本代理的分数-准确性相关性对其进行评估。然后,我们用计算图表示零成本代理,并利用 ViT 统计信息和原始操作来组织零成本代理搜索空间。为了发现通用的零成本代理,我们提出了一种联合相关性度量来进化和变异不同的零成本代理候选者。我们引入了一种精英保留策略以提高搜索效率,从而在利用和探索之间实现更好的权衡。基于发现的零成本代理,我们以免训练的方式进行 ViT 架构搜索。大量实验表明,我们的方法能很好地泛化到不同的数据集,并在排名相关性和最终准确性上均取得了 SOTA 结果。代码可在 https://github.com/lilujunai/Auto-Prox-AAAI24 找到。
引用
@article{arxiv.2312.09059,
title = {Auto-Prox: Training-Free Vision Transformer Architecture Search via Automatic Proxy Discovery},
author = {Zimian Wei and Lujun Li and Peijie Dong and Zheng Hui and Anggeng Li and Menglong Lu and Hengyue Pan and Zhiliang Tian and Dongsheng Li},
journal= {arXiv preprint arXiv:2312.09059},
year = {2023}
}
备注
Accepetd by AAAI2024