使用目标传播训练语言模型
计算与语言
2017-02-17 v1 机器学习
神经与进化计算
摘要
尽管截断时间反向传播(BPTT)是训练循环神经网络(RNNs)最流行的方法,但它存在固有序列性(难以并行化)以及截断远距离时间步间梯度流的缺点。我们探究了目标传播(TPROP)风格的方法能否解决这些缺陷。遗憾的是,大量实验表明TPROP总体表现不及BPTT,我们以对该现象的分析和未来工作建议作结。
引用
@article{arxiv.1702.04770,
title = {Training Language Models Using Target-Propagation},
author = {Sam Wiseman and Sumit Chopra and Marc'Aurelio Ranzato and Arthur Szlam and Ruoyu Sun and Soumith Chintala and Nicolas Vasilache},
journal= {arXiv preprint arXiv:1702.04770},
year = {2017}
}