中文

离散激活函数网络训练的实证探索

神经与进化计算 2018-01-17 v1 人工智能 计算机视觉与模式识别

摘要

我们给出了大量实验,训练和测试深度网络中仅输出预定义静态数量离散值的隐藏单元。这些单元在内存和/或计算可能受限的系统的实际部署中具有优势。此外,它们特别适用于需要在内存中维持大量内部状态的大型循环网络模型。令人惊讶的是,我们发现尽管将输出激活中可表示的值的数量从2322642^{32}-2^{64}减少到64到256之间,在各种不同设置下网络性能几乎没有或没有退化。我们研究了简单分类与回归任务,以及记忆与压缩问题。我们将结果与tanh和relu等更标准的激活函数进行比较。与以往通常仅关注二值单元的离散化研究不同,我们考察了允许激活电平数量变化的影响。与现有的离散化方法相比,本文提出的方法在概念和程序上均简单,无随机成分,并允许训练、测试和使用的阶段以完全相同的方式处理。

关键词

引用

@article{arxiv.1801.05156,
  title  = {Empirical Explorations in Training Networks with Discrete Activations},
  author = {Shumeet Baluja},
  journal= {arXiv preprint arXiv:1801.05156},
  year   = {2018}
}