面向鲁棒导弹自动驾驶仪设计的强化学习
机器学习
2021-09-21 v2 人工智能
机器人学
系统与控制
系统与控制
摘要
鉴于广阔的飞行包线与非线性飞行动力学,设计导弹自动驾驶仪控制器一直是一项复杂任务。既能出色达成标称性能又对不确定性具备鲁棒性的解决方案仍有待发现。控制理论常止于参数调度流程,而强化学习已在愈发复杂的任务中展现出有趣成果,从视频游戏到连续动作域的机器人任务皆有涵盖。然而,关于如何找到恰当的奖励函数与探索策略,仍缺乏更清晰的见解。据我们所知,本工作是首个提出以强化学习作为飞行控制框架的研究。事实上,其旨在训练一个无模型智能体来控制导弹的纵向飞行,实现最优性能与对不确定性的鲁棒性。为此,在TRPO方法下,所采集经验按HER增强,存入回放缓冲并根据其重要性采样。本工作不仅将优先经验回放的概念增强为BPER,还重构了HER,仅在训练进程收敛至次优策略时才同时激活二者,即所提出的SER方法。此外,奖励工程过程被详尽阐述。结果表明,通过在非标称环境中进一步训练,既可实现最优性能,又能提升智能体对不确定性的鲁棒性(对标称性能损害较低),从而验证了所提方法并鼓励该领域的未来研究。
引用
@article{arxiv.2011.12956,
title = {Reinforcement Learning for Robust Missile Autopilot Design},
author = {Bernardo Cortez},
journal= {arXiv preprint arXiv:2011.12956},
year = {2021}
}
备注
ICRLCT 2021 conference paper