具有函数近似的在线强化学习可从一般覆盖条件中获得什么益处?
机器学习
2023-06-01 v2 机器学习
摘要
在在线强化学习(RL)中,无需对马尔可夫决策过程(MDP)采用标准结构假设,使用某种覆盖条件(最初来自离线 RL)就足以保证样本高效性(Xie 等, 2023)。在这项工作中,我们聚焦于这一新方向,挖掘更多可能且一般的覆盖条件,并研究它们在高效在线 RL 中的潜力与效用。我们识别出更多概念,包括可集中性的 变体、密度比可实现性,以及部分/受限覆盖条件上的权衡,这些也能有益于样本高效的在线 RL,获得改进的 regret 界。此外,若使用探索性离线数据,在我们的覆盖条件下,在线 RL 可同时实现统计上和计算上的高效保证。再者,即便给定 MDP 结构,例如线性 MDP,我们阐明良好的覆盖条件仍有益于获得快于 的 regret 界甚至对数阶 regret。这些结果为在高效在线 RL 中使用一般覆盖条件提供了充分的依据。
引用
@article{arxiv.2304.12886,
title = {What can online reinforcement learning with function approximation benefit from general coverage conditions?},
author = {Fanghui Liu and Luca Viano and Volkan Cevher},
journal= {arXiv preprint arXiv:2304.12886},
year = {2023}
}
备注
Accepted by ICML 2023