中文

通过展开重加权 $\ell_1$-$\ell_1$ 最小化实现可解释深度循环神经网络:架构设计与泛化分析

机器学习 2020-03-19 v1 人工智能 机器学习

摘要

深度展开方法——例如学习迭代收缩阈值算法(LISTA)——将深度神经网络设计为优化方法的学习变体。这些网络已被证明比原始优化方法具有更快的收敛速度和更高的精度。在这类研究中,本文通过展开一种重加权 1\ell_1-1\ell_1 最小化算法,开发了一种新颖的深度循环神经网络(称为 reweighted-RNN),并将其应用于序列信号重建任务。据我们所知,这是首个探索重加权最小化的深度展开方法。由于底层的重加权最小化模型,我们的 RNN 对每一层中的每个隐藏单元都有不同的软阈值函数(即不同的激活函数)。此外,由于过参数化权重,它比现有的深度展开 RNN 模型具有更高的网络表达能力。重要的是,我们通过 Rademacher 复杂度建立了所提 reweighted-RNN 模型的理论泛化误差界。这些界限表明,所提 reweighted-RNN 的参数化保证了良好的泛化能力。我们将所提 reweighted-RNN 应用于从低维测量中重建视频帧的问题,即序列帧重建。在 moving MNIST 数据集上的实验结果表明,所提深度 reweighted-RNN 显著优于现有的 RNN 模型。

关键词

引用

@article{arxiv.2003.08334,
  title  = {Interpretable Deep Recurrent Neural Networks via Unfolding Reweighted $\ell_1$-$\ell_1$ Minimization: Architecture Design and Generalization Analysis},
  author = {Huynh Van Luong and Boris Joukovsky and Nikos Deligiannis},
  journal= {arXiv preprint arXiv:2003.08334},
  year   = {2020}
}

备注

Pre-print: 14 pages