利用线性回归探索紧凑的强化学习表示
机器学习
2012-05-14 v1 人工智能
摘要
本文提出一种新的在线线性回归算法,其效率保证满足KWIK(知其所知)框架的要求。该算法改进了当前最先进程序在此设置下的复杂度界限。我们探索了该算法在学习紧凑强化学习表示中的几种应用。我们证明,KWIK线性回归可用于学习因子化MDP的奖励函数以及随机STRIPS和面向对象MDP中动作结果的概率,这些在强化学习设置中之前都未被证明可高效学习。我们还将KWIK线性回归与其他KWIK学习器结合,学习这些模型的更大部分,包括联合学习因子化MDP转移和奖励函数的实验。
引用
@article{arxiv.1205.2606,
title = {Exploring compact reinforcement-learning representations with linear regression},
author = {Thomas J. Walsh and Istvan Szita and Carlos Diuk and Michael L. Littman},
journal= {arXiv preprint arXiv:1205.2606},
year = {2012}
}
备注
Appears in Proceedings of the Twenty-Fifth Conference on Uncertainty in Artificial Intelligence (UAI2009)