通过 Q-learning 求解连续控制
机器学习
2023-09-27 v2 人工智能
机器人学
摘要
尽管使用 actor-critic 方法求解连续控制已取得实质性成功,但更简单的仅含 critic 的方法(如 Q-learning)在相关高维动作空间中应用有限。然而,大多数 actor-critic 方法以增加的复杂性为代价:用于稳定的启发式方法、计算需求以及更宽的超参数搜索空间。我们展示了深度 Q-learning 的一个简单修改可大幅缓解这些问题。通过将 bang-bang 动作离散化与值分解相结合,将单智能体控制构建为协作多智能体强化学习(MARL),这种简单的仅含 critic 的方法在从特征或像素学习时匹配了最先进连续 actor-critic 方法的性能。我们将协作 MARL 中的经典 bandit 示例扩展,以直观说明解耦 critic 如何利用状态信息协调联合优化,并展示了在各类连续控制任务上令人惊讶的强劲性能。
引用
@article{arxiv.2210.12566,
title = {Solving Continuous Control via Q-learning},
author = {Tim Seyde and Peter Werner and Wilko Schwarting and Igor Gilitschenski and Martin Riedmiller and Daniela Rus and Markus Wulfmeier},
journal= {arXiv preprint arXiv:2210.12566},
year = {2023}
}