中文

从偏好中学习特技飞行

机器人学 2026-03-04 v2 机器学习

摘要

基于偏好的强化学习(PbRL)使智能体无需人工设计的奖励函数即可学习控制策略,这使其非常适合目标难以形式化或本质上具有主观性的任务。特技飞行因其复杂的动力学、快速的动作以及精确执行的重要性,构成了一个特别具有挑战性的问题。然而,为此类任务人工设计的奖励函数往往无法捕捉到真正重要的品质:我们发现,手工设计的奖励与人类判断的一致性仅为60.7%,这凸显了采用偏好驱动方法的必要性。在这项工作中,我们提出了置信度下奖励集成(REC),这是一个用于PbRL的概率奖励学习框架,它通过一个分布奖励模型集成来显式地建模每个时间步的奖励不确定性。通过将不确定性传播到偏好损失中,并利用分歧进行探索,REC在特技四旋翼飞行器控制上达到了成形奖励性能的88.4%,而标准偏好PPO仅为55.2%。我们在仿真中训练策略,并将其零样本成功迁移到现实世界,展示了纯粹从偏好反馈中学习到的复杂特技机动。我们进一步在连续控制基准上验证了REC,证实了其在空中机器人领域之外的适用性。

关键词

引用

@article{arxiv.2508.18817,
  title  = {Learning Acrobatic Flight from Preferences},
  author = {Colin Merk and Ismail Geles and Jiaxu Xing and Angel Romero and Giorgia Ramponi and Davide Scaramuzza},
  journal= {arXiv preprint arXiv:2508.18817},
  year   = {2026}
}

备注

8 pages, 6 figures