抵达自主竞速的极限:最优控制与强化学习之比较
机器人学
2023-10-19 v2 机器学习
摘要
机器人学中的一个核心问题是如何为敏捷移动机器人设计控制系统。本文系统性地研究这一问题,聚焦于一个极具挑战性的场景:自主无人机竞速。我们表明,在该场景下,通过强化学习(RL)训练的神经网络控制器优于最优控制(OC)方法。我们随后探究了哪些基本因素促成了 RL 的成功或限制了 OC。我们的研究表明,RL 相对于 OC 的根本优势并不在于其更好地优化目标,而在于其优化了更好的目标。OC 将问题分解为规划与控制,并以显式的中间表示(如轨迹)作为接口。这种分解限制了控制器可表达的行为范围,导致在面对未建模效应时控制性能不佳。相比之下,RL 可直接优化任务级目标,并能利用域随机化来应对模型不确定性,从而发现更鲁棒的控制响应。我们的发现使我们得以将敏捷无人机推至其最大性能,实现了大于 12 倍重力加速度的峰值加速度和 108 千米每小时的峰值速度。我们的策略在标准工作站上训练数分钟内即达到了超越人类的控制水平。本工作呈现了敏捷机器人学的一个里程碑,并阐明了 RL 与 OC 在机器人控制中的作用。
引用
@article{arxiv.2310.10943,
title = {Reaching the Limit in Autonomous Racing: Optimal Control versus Reinforcement Learning},
author = {Yunlong Song and Angel Romero and Matthias Mueller and Vladlen Koltun and Davide Scaramuzza},
journal= {arXiv preprint arXiv:2310.10943},
year = {2023}
}