深度网络中的平滑激活函数与可复现性
机器学习
2020-12-02 v2 神经与进化计算
机器学习
摘要
深度网络因其惊人的成功正逐渐渗透至我们生活中的几乎每个领域。然而,在获得实质性精度提升的同时,也付出了\emph{不可复现性}的代价。两个相同的模型在完全相同的训练集上训练,即使在平均准确率相近时,也可能对单个样本的预测表现出巨大差异,尤其是在高度分布式并行系统上训练时。流行的修正线性单元(ReLU)激活函数是深度网络近期成功的关键。然而,我们证明ReLU也是深度网络不可复现性的催化剂。我们表明,比ReLU更平滑的激活函数不仅能提供更好的准确率,还能提供更好的准确率-可复现性权衡。我们提出了一类新激活函数:平滑修正线性单元(\emph{SmeLU}),旨在提供此类更好的权衡,同时保持数学表达式简单,从而实现成本低廉。SmeLU是单调的,模仿ReLU,同时提供连续梯度,从而获得更好的可复现性。我们将SmeLU推广以提供更强的灵活性,并证明SmeLU及其推广形式是更通用方法——修正平滑连续单元(RESCU)激活函数的特例。实证结果展示了平滑激活函数(尤其是SmeLU)在准确率-可复现性权衡上的优越性。
引用
@article{arxiv.2010.09931,
title = {Smooth activations and reproducibility in deep networks},
author = {Gil I. Shamir and Dong Lin and Lorenzo Coviello},
journal= {arXiv preprint arXiv:2010.09931},
year = {2020}
}