深度强化学习中用于方差缩减的奖励估计
机器学习
2018-11-09 v2 人工智能
机器学习
摘要
强化学习(RL)智能体需要指定奖励信号以学习行为。然而,引入 corrupted 或随机奖励会导致学习过程中的高方差。此类 corruption 可能是目标设定错误、奖励信号中的随机性,或奖励与智能体未知的外部因素相关性的直接结果。奖励信号的 corruption 或随机性在机器人学中尤其成问题,因为复杂任务的目标设定可能特别困难。尽管已研究了许多方差缩减技术以提高 RL 过程的鲁棒性,处理此类随机或 corrupted 奖励结构仍然困难。作为在无模型 RL 方法中处理该场景的替代方案,我们建议使用一个针对奖励和值函数的估计器。我们证明,在表格和非线性函数逼近设定下,对于多种噪声类型和环境,这能改善在 corrupted 随机奖励下的性能。奖励估计的使用是一种鲁棒且易于实现的改进,用于处理无模型 RL 中的 corrupted 奖励信号。
引用
@article{arxiv.1805.03359,
title = {Reward Estimation for Variance Reduction in Deep Reinforcement Learning},
author = {Joshua Romoff and Peter Henderson and Alexandre Piché and Vincent Francois-Lavet and Joelle Pineau},
journal= {arXiv preprint arXiv:1805.03359},
year = {2018}
}
备注
Version 1 as appears in the International Conference on Learning Representations (ICLR) 2018 Workshop Track; Version 2 as appears in the Proceedings of The 2nd Conference on Robot Learning