中文

无状态强化学习

机器学习 2024-09-30 v1 人工智能

摘要

在本工作中,我们研究了“无状态强化学习”问题,即该算法在与环境交互之前没有状态信息。具体而言,令可达状态集合为 SΠ:={smaxπΠqP,π(s)>0}{S}^\Pi := \{ s|\max_{\pi\in \Pi}q^{P, \pi}(s)>0 \}, 我们设计了一个不要求对状态空间 SS 信息的算法,其悔 regret 完全独立于 S{S},仅取决于 SΠ{S}^\Pi。我们将其视为通往“无参数强化学习”的具体第一步,其目标是设计无需微调超参数的强化学习算法。

关键词

引用

@article{arxiv.2409.18439,
  title  = {State-free Reinforcement Learning},
  author = {Mingyu Chen and Aldo Pacchiano and Xuezhou Zhang},
  journal= {arXiv preprint arXiv:2409.18439},
  year   = {2024}
}