假设密度滤波 Q 学习
机器学习
2019-10-25 v4 人工智能
摘要
尽管离策略时间差分(TD)方法因其高效与实现简单在强化学习中得到广泛应用,但其贝叶斯对应方法并未被同样频繁地使用。一个原因是 Bellman 最优方程中的非线性 max 操作使得难以在值函数上定义共轭分布。本文中,我们引入一种新颖的离策略 TD 方法贝叶斯方法,称为 ADFQ,它通过一种称为假设密度滤波的在线贝叶斯推断方法更新对状态-动作值 Q 的信念。我们通过近似估计 Q 信念后验的分析参数,给出了值更新的高效闭式解。信念中的不确定性度量不仅用于探索,还为考虑所有后续可用动作的值更新提供了自然的正则化。随着 Q 信念不确定性度量的减小,ADFQ 收敛于 Q 学习,并改善了其他贝叶斯 RL 算法的常见缺陷,如计算复杂度。我们将 ADFQ 用神经网络扩展。我们的实证结果表明,ADFQ 在各种 Atari 2600 游戏上优于可比算法,在高度随机域或具有大动作空间的域中有显著改进。
引用
@article{arxiv.1712.03333,
title = {Assumed Density Filtering Q-learning},
author = {Heejin Jeong and Clark Zhang and George J. Pappas and Daniel D. Lee},
journal= {arXiv preprint arXiv:1712.03333},
year = {2019}
}
备注
source code: https://github.com/coco66/ADFQ.git ; IJCAI-19