中文

基于数据高效深度强化学习的多起点团队定向问题无人机系统任务重规划

机器学习 2023-03-06 v1 机器人学 最优化与控制

摘要

在本文中,我们研究多起点团队定向问题(MSTOP),这是一种任务重规划问题,其中载具初始位置远离仓库且拥有不同量的燃料。我们考虑/假设多辆载具的目标是在资源(如时间、燃料)消耗约束下最大化所收集收益之和。此类重规划问题广泛出现于智能无人机系统(UAS)应用中,其中任务环境的变化迫使多载具运行偏离原计划。为使用深度强化学习(RL)解决该问题,我们开发了具有每条部分路径自注意力以及部分路径与剩余节点间编码器-解码器注意力的策略网络。我们提出一种改进的REINFORCE算法,其中贪心rollout基线被基于多个可能非重复样本rollout的局部小批量基线替代。通过在每个训练实例上抽取多个样本,我们可以更快学习并以显著更少的实例获得稳定的策略梯度估计器。所提出的训练算法优于常规贪心rollout基线,即使其与最大熵目标结合时亦然。

关键词

引用

@article{arxiv.2303.01963,
  title  = {Multi-Start Team Orienteering Problem for UAS Mission Re-Planning with Data-Efficient Deep Reinforcement Learning},
  author = {Dong Ho Lee and Jaemyung Ahn},
  journal= {arXiv preprint arXiv:2303.01963},
  year   = {2023}
}

备注

48 pages, 18 figures, 7 tables