中文

具有函数近似的在线强化学习可从一般覆盖条件中获得什么益处?

机器学习 2023-06-01 v2 机器学习

摘要

在在线强化学习(RL)中,无需对马尔可夫决策过程(MDP)采用标准结构假设,使用某种覆盖条件(最初来自离线 RL)就足以保证样本高效性(Xie 等, 2023)。在这项工作中,我们聚焦于这一新方向,挖掘更多可能且一般的覆盖条件,并研究它们在高效在线 RL 中的潜力与效用。我们识别出更多概念,包括可集中性的 LpL^p 变体、密度比可实现性,以及部分/受限覆盖条件上的权衡,这些也能有益于样本高效的在线 RL,获得改进的 regret 界。此外,若使用探索性离线数据,在我们的覆盖条件下,在线 RL 可同时实现统计上和计算上的高效保证。再者,即便给定 MDP 结构,例如线性 MDP,我们阐明良好的覆盖条件仍有益于获得快于 O~(T)\widetilde{O}(\sqrt{T}) 的 regret 界甚至对数阶 regret。这些结果为在高效在线 RL 中使用一般覆盖条件提供了充分的依据。

关键词

引用

@article{arxiv.2304.12886,
  title  = {What can online reinforcement learning with function approximation benefit from general coverage conditions?},
  author = {Fanghui Liu and Luca Viano and Volkan Cevher},
  journal= {arXiv preprint arXiv:2304.12886},
  year   = {2023}
}

备注

Accepted by ICML 2023