通过可覆盖性实现可扩展的在线探索
机器学习
2024-06-06 v2 最优化与控制
机器学习
摘要
探索是强化学习中的一个主要挑战,特别是对于需要函数近似的高维领域。我们提出了探索目标——即能够支持下游任意奖励函数最大化的策略优化目标——作为系统化研究探索的概念框架。在此框架内,我们引入了一种新目标 -Coverage,它推广了先前的探索方案并支持三个基本需求:1. 内在复杂度控制。-Coverage 与一个结构参数 -Coverability 相关联,该参数反映了底层马尔可夫决策过程(MDP)的内在统计难度,涵盖了 Block MDP 和低秩 MDP。2. 高效规划。对于已知的 MDP,优化 -Coverage 可高效地简化为标准策略优化,允许与策略梯度和 Q-learning 等现成方法灵活集成。3. 高效探索。-Coverage 实现了首个计算高效的基于模型和无模型的算法,用于在低可覆盖性 MDP 中进行在线(无奖励或有奖励驱动)强化学习。实证研究表明,-Coverage 能有效驱动现成的策略优化算法探索状态空间。
引用
@article{arxiv.2403.06571,
title = {Scalable Online Exploration via Coverability},
author = {Philip Amortila and Dylan J. Foster and Akshay Krishnamurthy},
journal= {arXiv preprint arXiv:2403.06571},
year = {2024}
}
备注
ICML 2024