中文

面向时间最优四旋翼重规划的多保真度强化学习

机器人学 2025-08-08 v2

摘要

由于需要对复杂动力学进行精确建模,同时又受到计算能力的限制,无人机的高速在线轨迹规划构成了一个重大挑战。本文提出了一种多保真度强化学习方法(MFRL),旨在有效创建逼真的动力学模型,并同时训练一个可随时部署于实时应用的规划策略。所提出的方法涉及规划策略和奖励估计器的协同训练;后者预测策略输出的性能,并通过多保真度贝叶斯优化进行高效训练。这种优化方法对不同保真度水平之间的相关性进行建模,从而在低保真度基础上构建高保真度模型,使得能够在有限的高保真度实验下精确开发奖励模型。该框架进一步扩展,将真实世界飞行实验纳入强化学习训练,使奖励模型能够精确反映真实世界的约束,并拓宽策略在真实场景中的适用性。我们通过在仿真和真实环境中训练和测试规划策略,进行了严格的评估。与基线snap最小化方法相比,最终训练出的策略不仅生成了更快、更可靠的轨迹,而且平均在2毫秒内完成轨迹更新,而基线方法则需要几分钟。

关键词

引用

@article{arxiv.2403.08152,
  title  = {Multi-Fidelity Reinforcement Learning for Time-Optimal Quadrotor Re-planning},
  author = {Gilhyun Ryou and Geoffrey Wang and Sertac Karaman},
  journal= {arXiv preprint arXiv:2403.08152},
  year   = {2025}
}

备注

Accepted for publication in the International Journal of Robotics Research