中文

用于追逃博弈的新型多目标强化学习算法

系统与控制 2025-03-11 v1 系统与控制

摘要

在实际应用中,追逃博弈 (PEG) 通常涉及多个复杂且相互冲突的目标。单目标强化学习 (RL) 通常专注于单一优化目标,难以在多个目标之间找到最优平衡。本文提出了一种基于模糊 Q-learning (FQL) 的三目标 RL 算法,以解决具有不同优化目标的 PEG。首先,介绍了多目标 FQL 算法,该算法使用奖励函数来表示三个优化目标:逃避追击、到达目标和避开障碍。其次,设计了一种基于三维超体积的多目标评估方法和动作选择策略,解决了探索与利用的困境。通过对 Pareto 前沿进行采样,获得了全局策略的更新规则。所提出的算法在确保探索能力的同时降低了计算负荷。最后,通过仿真结果验证了该算法的性能。

关键词

引用

@article{arxiv.2503.06741,
  title  = {A Novel Multi-Objective Reinforcement Learning Algorithm for Pursuit-Evasion Game},
  author = {Penglin Hu and Chunhui Zhao and Quan Pan},
  journal= {arXiv preprint arXiv:2503.06741},
  year   = {2025}
}

备注

23 pages, 10 figures, 1 tables