面向 Vision Transformer 的可微架构搜索:DASViT
机器学习
2025-07-18 v1 计算机视觉与模式识别
摘要
设计有效的神经网络是深度学习的基石,神经网络架构搜索(NAS)已成为自动化这一过程的强大工具。尽管已有多种 NAS 方法,但以 DARTS 为代表的可微架构搜索因其高效便捷而广受欢迎,催生了众多突破。自 Vision Transformer(ViT)兴起以来,研究者们已将 NAS 应用于探索 ViT 架构,往往侧重宏观级搜索空间,依赖离散方法如进化算法。虽然这些方法确保可靠性,但面临在发现创新性架构设计方面不足、计算资源密集以及耗时等挑战。为此,我们提出面向 Vision Transformer 的可微架构搜索框架 DASViT,填补了 ViT 可微搜索的空白,揭示了新颖的设计。实验表明,DASViT 所生成的架构打破了传统 Transformer 编码器设计,多个数据集上超越 ViT-B/16,同时以更少参数和 FLOPs 实现卓越效率。
引用
@article{arxiv.2507.13079,
title = {DASViT: Differentiable Architecture Search for Vision Transformer},
author = {Pengjin Wu and Ferrante Neri and Zhenhua Feng},
journal= {arXiv preprint arXiv:2507.13079},
year = {2025}
}
备注
Accepted to the International Joint Conference on Neural Networks (IJCNN) 2025