中文

通过 Q-learning 求解连续控制

机器学习 2023-09-27 v2 人工智能 机器人学

摘要

尽管使用 actor-critic 方法求解连续控制已取得实质性成功,但更简单的仅含 critic 的方法(如 Q-learning)在相关高维动作空间中应用有限。然而,大多数 actor-critic 方法以增加的复杂性为代价:用于稳定的启发式方法、计算需求以及更宽的超参数搜索空间。我们展示了深度 Q-learning 的一个简单修改可大幅缓解这些问题。通过将 bang-bang 动作离散化与值分解相结合,将单智能体控制构建为协作多智能体强化学习(MARL),这种简单的仅含 critic 的方法在从特征或像素学习时匹配了最先进连续 actor-critic 方法的性能。我们将协作 MARL 中的经典 bandit 示例扩展,以直观说明解耦 critic 如何利用状态信息协调联合优化,并展示了在各类连续控制任务上令人惊讶的强劲性能。

关键词

引用

@article{arxiv.2210.12566,
  title  = {Solving Continuous Control via Q-learning},
  author = {Tim Seyde and Peter Werner and Wilko Schwarting and Igor Gilitschenski and Martin Riedmiller and Daniela Rus and Markus Wulfmeier},
  journal= {arXiv preprint arXiv:2210.12566},
  year   = {2023}
}