超越均匀缩放:探索神经架构中的深度异质性
机器学习
2024-02-21 v1 人工智能
神经与进化计算
摘要
传统的神经网络缩放通常涉及设计一个基础网络,并按照某些预定义的缩放因子增加其宽度、深度等不同维度。我们引入了一种利用二阶损失景观信息的自动缩放方法。该方法对现代视觉 Transformer 中的核心组件跳跃连接具有灵活性。我们的训练感知方法无需额外的训练迭代,即可对 Transformer 进行联合缩放和训练。基于并非所有神经元都需要均匀深度复杂度的假设,我们的方法采用了深度异质性。在 DeiT-S 和 ImageNet100 上的广泛评估表明,与常规缩放相比,准确率提升了 2.5%,参数效率提升了 10%。缩放后的网络在从头开始训练小规模数据集时展现出更优异的性能。我们引入了首个针对视觉 Transformer 的无损缩放机制,向高效的模型缩放迈出了一步。
引用
@article{arxiv.2402.12418,
title = {Beyond Uniform Scaling: Exploring Depth Heterogeneity in Neural Architectures},
author = {Akash Guna R. T and Arnav Chavan and Deepak Gupta},
journal= {arXiv preprint arXiv:2402.12418},
year = {2024}
}
备注
Accepted At ICLR 2024 (Tiny Paper Track)