中文

深度强化学习避撞系统的奖励函数优化

人工智能 2022-12-05 v1 机器人学

摘要

无人飞机系统(UAS)的激增已促使空域管理当局审视这些飞机与最初为大型运输类飞机设计的避撞系统之间的互操作性。当前强制要求的 TCAS 的局限性导致美国联邦航空管理局委托开发一种新方案,即机载避撞系统 X(ACAS X),旨在为包括 UAS 在内的多种飞机平台提供避撞能力。尽管先前研究探索了使用深度强化学习算法(DRL)进行避撞,但 DRL 的表现不如现有方案。本工作探讨了使用参数经代理优化器调优的 DRL 避撞系统的益处。我们展示了使用代理优化器可催生一种 DRL 方法,能够提升安全性与运行可行性,并支撑 UAS 避撞的未来能力开发。

关键词

引用

@article{arxiv.2212.00855,
  title  = {Reward Function Optimization of a Deep Reinforcement Learning Collision Avoidance System},
  author = {Cooper Cone and Michael Owen and Luis Alvarez and Marc Brittain},
  journal= {arXiv preprint arXiv:2212.00855},
  year   = {2022}
}