中文

Bang-Bang 控制是你所需的一切吗?用伯努利策略求解连续控制

机器学习 2021-11-05 v1 人工智能 机器人学

摘要

用于连续控制的强化学习(RL)通常采用其支撑覆盖整个动作空间的分布。在本研究中,我们探讨了一个广为人知的现象,即训练后的智能体通常偏好处于该空间边界的动作。我们将其与最优控制中 bang-bang 行为的出现建立了理论联系,并在多种近期的 RL 算法上进行了广泛的实证评估。我们用仅考虑每个动作维度极值的伯努利分布(即 bang-bang 控制器)取代了常规的高斯分布。令人惊讶的是,这在几个连续控制基准上取得了 SOTA 的性能——这与机器人硬件不同,在机器人硬件中能量和维护成本会影响控制器的选择。由于探索、学习和最终解决方案在 RL 中相互交织,我们提供了额外的模仿学习实验,以减少探索对我们分析的影响。最后,我们表明我们的观察结果可推广至旨在模拟现实世界挑战的环境中,并评估了缓解 bang-bang 解决方案出现的因素。我们的发现强调了连续控制算法基准测试面临的挑战,特别是在潜在的现实世界应用方面。

关键词

引用

@article{arxiv.2111.02552,
  title  = {Is Bang-Bang Control All You Need? Solving Continuous Control with Bernoulli Policies},
  author = {Tim Seyde and Igor Gilitschenski and Wilko Schwarting and Bartolomeo Stellato and Martin Riedmiller and Markus Wulfmeier and Daniela Rus},
  journal= {arXiv preprint arXiv:2111.02552},
  year   = {2021}
}