融合强化学习算法的无人机惯性导航技术研究
机器人学
2023-07-27 v1
摘要
我们首先定义合适的状态表示与动作空间,然后设计一种基于智能体所选动作的调整机制。该调整机制输出智能体的下一状态与奖励值。此外,调整机制计算调整后状态与未调整状态之间的误差。进而,智能体将包含状态与奖励值的所获经验样本存储于缓冲器中,并在每次迭代中回放经验以学习环境的动态特性。我们将改进算法命名为 DQM 算法。实验结果表明,使用我们所提算法的智能体有效降低了动态环境中惯性导航的累积误差。尽管我们的研究为实现无人机自主导航提供了基础,仍有较大优化空间。进一步研究可包括:在仿真环境中测试无人机、在真实环境中测试无人机、优化奖励函数设计、改进算法工作流程以提升收敛速度与性能,以及增强算法的泛化能力。
引用
@article{arxiv.2307.14038,
title = {Research on Inertial Navigation Technology of Unmanned Aerial Vehicles with Integrated Reinforcement Learning Algorithm},
author = {Longcheng Guo},
journal= {arXiv preprint arXiv:2307.14038},
year = {2023}
}
备注
20 pages; 6 figures