中文

神经网络的黎曼度量 II:循环网络与符号数据序列学习

神经与进化计算 2015-02-04 v4 机器学习

摘要

循环神经网络是处理序列数据的强大模型,能够表示隐藏马尔可夫模型等简单模型无法处理的序列中的复杂依赖关系。然而,它们 notoriously 难以训练。在此,我们引入了一种利用黎曼度量中的梯度上升进行训练的过程:该算法独立于参数编码和单元活动等设计选择。这种度量梯度上升旨在使稀疏连接网络的算法成本接近通过时间的反向传播。我们将此过程应用于门控漏液神经网络(GLNNs),这是一种循环神经网络的变体,其架构受有限自动机启发,演化方程受连续时间网络启发。研究表明,采用黎曼梯度训练的 GLNNs 能够有效捕捉合成问题中的多种结构:如上下文无关文法中的基本块嵌套(自然语言的重要特征,但难以学习)、多个独立马尔可夫型关系的交集,或远距离关系(如 distant-XOR 问题)。该方法无需调整网络结构或初始参数:所使用的网络是稀疏随机图,且对所有考虑的问题初始化均相同。

关键词

引用

@article{arxiv.1306.0514,
  title  = {Riemannian metrics for neural networks II: recurrent networks and learning symbolic data sequences},
  author = {Yann Ollivier},
  journal= {arXiv preprint arXiv:1306.0514},
  year   = {2015}
}

备注

4th version: some changes in notation, more experiments