中文

面向Vision Transformer的零样态NAS的L-SWAG:基于层级抽样激活与梯度信息

计算机视觉与模式识别 2025-05-13 v1

摘要

训练自由神经网络搜索(NAS)高效地使用零成本(ZC)代理识别高性能神经网络。与多 shot 和 one shot NAS 方法不同,ZC-NAS 同时具备(i)高效性,消除模型训练需求;(ii)可解释性,代理设计常在理论上具有依据。尽管该领域取得了快速进展,但当前的最佳 ZC 代理通常受限于已建立的卷积搜索空间。随着大型语言模型塑造深度学习的未来,本工作将 ZC 代理的适用性扩展到 Vision Transformer(ViT)。我们构建了一个在 6 个不同任务上评估 Autoformer 搜索空间的新基准,并提出了基于层级抽样激活与梯度信息(L-SWAG),一种新型通用度量,能够在 14 个任务上刻画卷积和 transformer 架构。此外,前人工作指出不同代理包含互补信息,促使需要一种 ML 模型来识别有用组合。为进一步提升 ZC-NAS,我们因此引入了 LIBRA-NAS(低信息增益和偏差重新校准),一种策略性地将代理组合以最佳代表特定基准的方法。集成到 NAS 搜索中,LIBRA-NAS 在 ImageNet1k 上仅用 0.1 个 GPU 天即可识别出误差为 17.0% 的体系结构。

关键词

引用

@article{arxiv.2505.07300,
  title  = {L-SWAG: Layer-Sample Wise Activation with Gradients information for Zero-Shot NAS on Vision Transformers},
  author = {Sofia Casarin and Sergio Escalera and Oswald Lanz},
  journal= {arXiv preprint arXiv:2505.07300},
  year   = {2025}
}

备注

accepted at CVPR 2025