驯服“数据饥渴”的强化学习?连续状态-动作空间中的稳定性
机器学习
2024-01-11 v1 信息论
系统与控制
系统与控制
math.IT
最优化与控制
机器学习
摘要
我们引入了一个新颖的框架来分析连续状态-动作空间中的强化学习(RL),并利用该框架证明了在离线与在线两种设置下的快速收敛速率。我们的分析突出了两个关键的稳定性性质,它们涉及价值函数和/或策略的变化如何影响贝尔曼算子与占据测度。我们认为,这些性质在许多连续状态-动作马尔可夫决策过程中都能得到满足,并展示了它们在使用线性函数逼近方法时如何自然产生。我们的分析为悲观主义与乐观主义在离线与在线强化学习中的作用提供了新的视角,并揭示了离线强化学习与迁移学习之间的联系。
引用
@article{arxiv.2401.05233,
title = {Taming "data-hungry" reinforcement learning? Stability in continuous state-action spaces},
author = {Yaqi Duan and Martin J. Wainwright},
journal= {arXiv preprint arXiv:2401.05233},
year = {2024}
}