Backprop-Q:面向随机计算图的广义反向传播
机器学习
2019-01-09 v2 人工智能
机器学习
摘要
在真实场景中,学习一个内部执行随机操作的模型(称为随机计算图,SCG)而非学习确定性映射颇具吸引力。然而,标准反向传播不适用于SCG。我们试图从代价传播的视角解决此问题,为SCG中每个随机节点构造并学习称为Q函数的局部代理代价。随后,SCG可基于这些代理代价使用标准反向传播进行训练。我们提出将整个框架作为广义化SCG反向传播的解决方案,其类似基于图的 actor-critic 架构。为广泛适用性,我们研究从单代价到多代价的多种SCG结构。我们利用强化学习(RL)与变分贝叶斯(VB)的近期进展,如离策略评论家学习与无偏低方差梯度估计,并在SCG背景下予以评述。该广义反向传播将传输的学习信号扩展至随机节点间梯度之外,同时保留通过确定性节点反向传播梯度的益处。我们列出了实验建议与注意事项,以帮助使用该框架设计与测试任何特定模型。
引用
@article{arxiv.1807.09511,
title = {Backprop-Q: Generalized Backpropagation for Stochastic Computation Graphs},
author = {Xiaoran Xu and Songpeng Zu and Yuan Zhang and Hanning Zhou and Wei Feng},
journal= {arXiv preprint arXiv:1807.09511},
year = {2019}
}
备注
NeurIPS 2018 Deep Reinforcement Learning Workshop