中文

放大模仿效应以增强 UCAV 任务执行的强化学习

机器学习 2019-01-18 v1 人工智能

摘要

本文提出一种新的强化学习(RL)算法,通过放大模仿效应(AIE)来增强探索。该算法由自我模仿学习与随机网络蒸馏算法组成。我们认为这两种算法互为补充,且结合二者可放大探索中的模仿效应。此外,通过对 RL 智能体频繁访问的状态添加内在惩罚奖励,并在使用探索奖励时利用回放记忆学习特征状态,所提方法实现了深度探索并偏离当前收敛策略。我们通过在二维网格环境中的实验验证了算法的探索性能。此外,我们将该算法应用于无人作战飞机(UCAV)任务执行的模拟环境,实证结果表明 AIE 对于寻找 UCAV 规避敌方导弹的最短飞行路径非常有效。

关键词

引用

@article{arxiv.1901.05856,
  title  = {Amplifying the Imitation Effect for Reinforcement Learning of UCAV's Mission Execution},
  author = {Gyeong Taek Lee and Chang Ouk Kim},
  journal= {arXiv preprint arXiv:1901.05856},
  year   = {2019}
}

备注

9 pages