异步课程经验回放:一种用于未知动态环境中无人机自主运动控制的深度强化学习方法
人工智能
2022-07-05 v1
摘要
无人机(UAVs)已广泛应用于军事战争。在本文中,我们将自主运动控制(AMC)问题表述为马尔可夫决策过程(MDP),并提出一种先进的深度强化学习(DRL)方法,使无人机能够在大规模动态三维(3D)环境中执行复杂任务。为克服优先经验回放(PER)算法的局限并提升性能,所提出的异步课程经验回放(ACER)利用多线程异步更新优先级,分配真实优先级,并应用临时经验池以提供可用于学习的更高质量经验。还引入了先入无用出(FIUO)经验池,以确保所存储经验的更高使用价值。此外,结合课程学习(CL),设计了一种从易到难采样经验的更合理训练范式来训练无人机。通过在基于真实无人机参数构建的复杂未知环境中训练,所提出的ACER相比最先进的双延迟深度确定性策略梯度(TD3)算法,收敛速度提高了24.66%,收敛结果提高了5.59%。在不同复杂度的环境中进行的测试实验证明了ACER智能体的强鲁棒性和泛化能力。
引用
@article{arxiv.2207.01251,
title = {Asynchronous Curriculum Experience Replay: A Deep Reinforcement Learning Approach for UAV Autonomous Motion Control in Unknown Dynamic Environments},
author = {Zijian Hu and Xiaoguang Gao and Kaifang Wan and Qianglong Wang and Yiwei Zhai},
journal= {arXiv preprint arXiv:2207.01251},
year = {2022}
}