探索地磁导航的泛化性:一种基于深度强化学习与策略蒸馏的方法
机器人学
2025-02-10 v1
摘要
自动驾驶技术的进步使得在未知环境中的导航和探索成为可能。地磁导航因其不依赖 GPS 或惯性导航设备而受到越来越多的关注。虽然地磁导航方法已被广泛研究,但所学地磁导航策略的泛化性仍未得到探索。由于缺乏对新进入区域地磁特性的了解,所学策略在其源域之外的性能可能会下降。本文通过深度强化学习(DRL)探索了所学地磁导航策略的泛化问题。具体而言,我们采用 DRL 智能体从代表分散导航策略的分布式域中学习多个教师模型,并将这些教师模型融合以实现跨导航区域的泛化性。我们在训练教师模型时设计了一种奖励塑形机制,其中集成了基于势能的奖励和内在动机奖励。所设计的奖励塑形可以增强 DRL 智能体的探索效率,并改善教师模型的表示。基于获得的教师模型,我们采用多教师策略蒸馏来融合各个教师学到的策略,从而得到一个在跨导航域具有泛化能力的导航策略。我们进行了数值仿真,结果表明所学 DRL 模型从源域到新导航区域的有效迁移。与现有的基于进化的地磁导航方法相比,我们的方法在跨域导航中的导航长度、持续时间、航向偏差和成功率方面均表现出优越的性能。
引用
@article{arxiv.2502.05069,
title = {Exploring the Generalizability of Geomagnetic Navigation: A Deep Reinforcement Learning approach with Policy Distillation},
author = {Wenqi Bai and Shiliang Zhang and Xiaohui Zhang and Xuehui Ma and Songnan Yang and Yushuai Li and Tingwen Huang},
journal= {arXiv preprint arXiv:2502.05069},
year = {2025}
}