改进循环神经网络的门控机制
神经与进化计算
2020-06-22 v2 机器学习
摘要
门控机制广泛用于神经网络模型,使梯度更易通过深度或时间反向传播。然而,其饱和特性带来了自身的问题。例如,在循环模型中,这些门需要输出接近 1 才能长时间延迟传播信息,这要求它们在饱和区工作,并阻碍了对门机制的基于梯度的学习。我们通过推导对标准门控机制的两项协同修改来解决此问题,这些修改易于实现、不引入额外超参数,并在门接近饱和时改善其可学习性。我们展示了这些改变如何与近期提出的替代门控机制(如 chrono 初始化与 Ordered Neurons)相关并改进之。经验上,我们简单的门控机制稳健地改善了循环模型在一系列应用上的性能,包括合成记忆任务、序列图像分类、语言建模与强化学习,尤其在涉及长期依赖时。
引用
@article{arxiv.1910.09890,
title = {Improving the Gating Mechanism of Recurrent Neural Networks},
author = {Albert Gu and Caglar Gulcehre and Tom Le Paine and Matt Hoffman and Razvan Pascanu},
journal= {arXiv preprint arXiv:1910.09890},
year = {2020}
}
备注
International Conference on Machine Learning 2020