中文

超越均匀缩放:探索神经架构中的深度异质性

机器学习 2024-02-21 v1 人工智能 神经与进化计算

摘要

传统的神经网络缩放通常涉及设计一个基础网络,并按照某些预定义的缩放因子增加其宽度、深度等不同维度。我们引入了一种利用二阶损失景观信息的自动缩放方法。该方法对现代视觉 Transformer 中的核心组件跳跃连接具有灵活性。我们的训练感知方法无需额外的训练迭代,即可对 Transformer 进行联合缩放和训练。基于并非所有神经元都需要均匀深度复杂度的假设,我们的方法采用了深度异质性。在 DeiT-S 和 ImageNet100 上的广泛评估表明,与常规缩放相比,准确率提升了 2.5%,参数效率提升了 10%。缩放后的网络在从头开始训练小规模数据集时展现出更优异的性能。我们引入了首个针对视觉 Transformer 的无损缩放机制,向高效的模型缩放迈出了一步。

关键词

引用

@article{arxiv.2402.12418,
  title  = {Beyond Uniform Scaling: Exploring Depth Heterogeneity in Neural Architectures},
  author = {Akash Guna R. T and Arnav Chavan and Deepak Gupta},
  journal= {arXiv preprint arXiv:2402.12418},
  year   = {2024}
}

备注

Accepted At ICLR 2024 (Tiny Paper Track)