采样策略梯度算法泛化能力的调查研究
机器学习
2019-10-10 v1 人工智能
摘要
采样策略梯度(SPG)算法是一种新的离线 actor-critic 变体,它在动作空间中采样以近似策略梯度,具体利用 critic 来评估被采样的动作。SPG 相较于 DPG 等类似算法具有理论上的前景,因为它独立于局部梯度搜索动作-Q 值空间,从而能够避免局部极小。本文旨在将 SPG 与两种类似的 actor-critic 算法 CACLA 和 DPG 进行比较。比较在两种不同环境、两种不同网络架构下进行,并且相较于使用经验回放缓冲,还采用了 on-policy 转移进行训练。结果似乎表明,尽管 SPG 通常并非表现最差,但它并非总能在特定任务上匹配表现最佳算法的性能。需要进一步实验以更好地评估 SPG 的特性。
引用
@article{arxiv.1910.03728,
title = {Investigation on the generalization of the Sampled Policy Gradient algorithm},
author = {Nil Stolt Ansó},
journal= {arXiv preprint arXiv:1910.03728},
year = {2019}
}