稀疏强化学习的贪婪算法
机器学习
2012-07-03 v1 机器学习
摘要
特征选择和正则化正成为强化学习(RL)社区扩大 RL 覆盖范围和适用性的日益重要的工具。解决特征选择问题的一种方法是对学习方法施加诱导稀疏性的正则化形式。近期关于 正则化的工作采用了监督学习文献中的技术并将其应用于 RL。另一种在监督学习社区重新受到关注的方法是使用一种贪婪地添加新特征的简单算法。此类算法具有 正则化方法的许多优良特性,同时极其高效,并且在某些情况下允许从采样数据中恢复稀疏目标函数真实形式的理论保证。本文考虑了应用于强化学习的正交匹配追踪(OMP)的变体。我们对所得算法进行了分析,并在实验上与现有的 正则化方法进行了比较。我们证明,也许人们希望实现稀疏恢复的最自然场景会失败;然而,一个变体 OMP-BRM 在特征字典的某些假设下提供了有希望的理论保证。另一个变体 OMP-TD 在多个基准问题上,无论在近似精度还是效率方面,均在实证上优于 prior 方法。
引用
@article{arxiv.1206.6485,
title = {Greedy Algorithms for Sparse Reinforcement Learning},
author = {Christopher Painter-Wakefield and Ronald Parr},
journal= {arXiv preprint arXiv:1206.6485},
year = {2012}
}
备注
Appears in Proceedings of the 29th International Conference on Machine Learning (ICML 2012)