基于无手工设计奖励函数的自动课程强化学习的机动决策
人工智能
2023-07-13 v1 机器学习
机器人学
摘要
机动决策是无人作战飞机实现自主空战的核心。为解决该问题,我们提出一种自动课程强化学习方法,使智能体能够从零开始在空战中学习有效决策。利用初始状态的范围来区分不同难度等级的课程,从而将机动决策划分为一系列由易到难的子任务,并借助测试结果切换子任务。随着子任务的变化,智能体逐步学会由易到难完成一系列子任务,使其能够在无需费力设计奖励函数的情况下,针对各种状态做出有效的机动决策。消融研究表明,本文提出的自动课程学习是通过强化学习进行训练的必备组件,即若无课程学习,智能体无法完成有效决策。仿真实验表明,训练后的智能体能够在给定不同状态(包括追踪、攻击与逃逸)时做出合理且可解释的有效决策。
引用
@article{arxiv.2307.06152,
title = {Maneuver Decision-Making Through Automatic Curriculum Reinforcement Learning Without Handcrafted Reward functions},
author = {Zhang Hong-Peng},
journal= {arXiv preprint arXiv:2307.06152},
year = {2023}
}