中文

通过可覆盖性实现可扩展的在线探索

机器学习 2024-06-06 v2 最优化与控制 机器学习

摘要

探索是强化学习中的一个主要挑战,特别是对于需要函数近似的高维领域。我们提出了探索目标——即能够支持下游任意奖励函数最大化的策略优化目标——作为系统化研究探索的概念框架。在此框架内,我们引入了一种新目标 L1L_1-Coverage,它推广了先前的探索方案并支持三个基本需求:1. 内在复杂度控制。L1L_1-Coverage 与一个结构参数 L1L_1-Coverability 相关联,该参数反映了底层马尔可夫决策过程(MDP)的内在统计难度,涵盖了 Block MDP 和低秩 MDP。2. 高效规划。对于已知的 MDP,优化 L1L_1-Coverage 可高效地简化为标准策略优化,允许与策略梯度和 Q-learning 等现成方法灵活集成。3. 高效探索。L1L_1-Coverage 实现了首个计算高效的基于模型和无模型的算法,用于在低可覆盖性 MDP 中进行在线(无奖励或有奖励驱动)强化学习。实证研究表明,L1L_1-Coverage 能有效驱动现成的策略优化算法探索状态空间。

关键词

引用

@article{arxiv.2403.06571,
  title  = {Scalable Online Exploration via Coverability},
  author = {Philip Amortila and Dylan J. Foster and Akshay Krishnamurthy},
  journal= {arXiv preprint arXiv:2403.06571},
  year   = {2024}
}

备注

ICML 2024