基于卡尔曼滤波的信赖域价值优化
机器学习
2019-01-24 v1 机器学习
摘要
策略评估是强化学习中的关键过程。它通过对相应价值函数的估计来评估给定策略。当使用参数化函数逼近价值时,通常通过最小化贝尔曼时序差分误差的平方和来优化参数集。然而,该方法忽略了误差与价值参数的某些分布特性。在优化过程中考虑这些分布可提供关于价值估计置信程度的有用信息。本工作中,我们提出通过最小化一个在其参数上形成信赖域的正则化目标函数来优化价值。我们提出了一种新颖的优化方法——基于扩展卡尔曼滤波的价值逼近卡尔曼优化(KOVA)。KOVA 通过对价值参数与含噪观测回报采用贝叶斯视角来最小化正则化目标函数。这一分布特性除价值估计外还提供了参数不确定性的信息。我们给出了方法的理论结果,并在具有大状态与动作空间的任务上分析了所提优化器的性能。
引用
@article{arxiv.1901.07860,
title = {Trust Region Value Optimization using Kalman Filtering},
author = {Shirli Di-Castro Shashua and Shie Mannor},
journal= {arXiv preprint arXiv:1901.07860},
year = {2019}
}