actor-critic 算法的约束优化视角及其在网络路由中的应用
机器学习
2015-07-30 v1 最优化与控制
摘要
我们提出了一种新颖的 actor-critic 算法,可保证收敛到折扣奖励马尔可夫决策过程的最优策略。该 actor 融入了受某非线性优化问题解启发的下降方向。我们还讨论了结合函数近似的扩展,并在网络路由应用上展示了我们算法的实用性。
引用
@article{arxiv.1507.07984,
title = {A constrained optimization perspective on actor critic algorithms and application to network routing},
author = {Prashanth L. A. and H. L. Prasad and Shalabh Bhatnagar and Prakash Chandra},
journal= {arXiv preprint arXiv:1507.07984},
year = {2015}
}