三角丢弃:无需重训练的可变网络宽度
机器学习
2022-05-04 v1 神经与进化计算
摘要
神经网络最基础的设计选择之一是层宽度:它影响网络可学习的容量,并决定解的复杂度。后一特性常在引入信息瓶颈时被利用,迫使网络学习压缩表示。然而,此类架构决策一旦训练开始通常便不可更改;切换到更压缩的架构需要重新训练。本文提出一种称为三角丢弃(Triangular Dropout)的新层设计,它不受此限制。训练后,该层宽度可任意缩减,以性能换取窄度。我们在三个领域展示了这种机制的构建与潜在用例。首先,我们在自编码器中描述三角丢弃的构造,创建训练后可选择压缩程度的模型。其次,我们将三角丢弃加入 ImageNet 上的 VGG19,创建一个强大的网络,无需重训练即可显著减少参数量。最后,我们探索三角丢弃在选定控制问题上的强化学习(RL)策略中的应用。
引用
@article{arxiv.2205.01235,
title = {Triangular Dropout: Variable Network Width without Retraining},
author = {Edward W. Staley and Jared Markowitz},
journal= {arXiv preprint arXiv:2205.01235},
year = {2022}
}