一类用于强化学习的通用鲁棒随机算子
机器学习
2019-05-29 v2 机器学习
摘要
我们考虑一类用于强化学习的新算子,旨在减轻近似或估计误差的负面影响并增强对其的鲁棒性。我们建立了若干理论结果,包括在具体样本路径基础上证明我们的算子族保持最优性并增大动作间隙。我们的实证结果说明了该类算子的显著优势,其性能大幅优于经典Bellman算子及近期提出的算子。
引用
@article{arxiv.1805.08122,
title = {A General Family of Robust Stochastic Operators for Reinforcement Learning},
author = {Yingdong Lu and Mark S. Squillante and Chai Wah Wu},
journal= {arXiv preprint arXiv:1805.08122},
year = {2019}
}
备注
12 pages