Angrier Birds:贝叶斯强化学习
人工智能
2016-01-08 v2 机器学习
摘要
我们训练了一个强化学习智能体来玩简化版的 Angry Birds 游戏。该学习器以类似于计算机视觉算法可能产生的输出的方式获得游戏状态。我们通过 Randomized Least Squares Value Iteration (RLSVI) 中更系统的探索,改进了带有线性函数逼近的常规 {\epsilon}-贪婪 Q-Learning 的效率,RLSVI 是一种从最优策略的后验分布中采样其策略的算法。随着状态-动作空间增大,高效探索变得愈发重要,RLSVI 中更快的学习证明了这一点。
引用
@article{arxiv.1601.01297,
title = {Angrier Birds: Bayesian reinforcement learning},
author = {Imanol Arrieta Ibarra and Bernardo Ramos and Lars Roemheld},
journal= {arXiv preprint arXiv:1601.01297},
year = {2016}
}
备注
Stanford University CS221 Final Project