基于方差的奖励用于近似贝叶斯强化学习
机器学习
2012-03-19 v1 人工智能
机器学习
摘要
探索-利用困境是强化学习(RL)中的核心挑战之一。贝叶斯RL通过以环境上的先验分布形式向智能体提供信息来解决这一困境;然而,完全的贝叶斯规划是难以处理的。使用平均MDP进行规划是贝叶斯规划的一种常见近视近似。我们推导出一种新颖的奖励加成,它是环境后验分布的函数,当将其添加到平均MDP规划中的奖励时,会产生一个高效且有效探索的智能体。尽管我们的方法在给定无信息或无结构先验时与现有方法相似,但与现有方法不同,我们的方法可以利用结构化先验。我们证明了我们的方法具有多项式样本复杂度,并在结构化探索任务中实证展示了其优势。
引用
@article{arxiv.1203.3518,
title = {Variance-Based Rewards for Approximate Bayesian Reinforcement Learning},
author = {Jonathan Sorg and Satinder Singh and Richard L. Lewis},
journal= {arXiv preprint arXiv:1203.3518},
year = {2012}
}
备注
Appears in Proceedings of the Twenty-Sixth Conference on Uncertainty in Artificial Intelligence (UAI2010)