中文

三角丢弃:无需重训练的可变网络宽度

机器学习 2022-05-04 v1 神经与进化计算

摘要

神经网络最基础的设计选择之一是层宽度:它影响网络可学习的容量,并决定解的复杂度。后一特性常在引入信息瓶颈时被利用,迫使网络学习压缩表示。然而,此类架构决策一旦训练开始通常便不可更改;切换到更压缩的架构需要重新训练。本文提出一种称为三角丢弃(Triangular Dropout)的新层设计,它不受此限制。训练后,该层宽度可任意缩减,以性能换取窄度。我们在三个领域展示了这种机制的构建与潜在用例。首先,我们在自编码器中描述三角丢弃的构造,创建训练后可选择压缩程度的模型。其次,我们将三角丢弃加入 ImageNet 上的 VGG19,创建一个强大的网络,无需重训练即可显著减少参数量。最后,我们探索三角丢弃在选定控制问题上的强化学习(RL)策略中的应用。

关键词

引用

@article{arxiv.2205.01235,
  title  = {Triangular Dropout: Variable Network Width without Retraining},
  author = {Edward W. Staley and Jared Markowitz},
  journal= {arXiv preprint arXiv:2205.01235},
  year   = {2022}
}