中文

面向认知雷达资源管理的多目标强化学习

机器学习 2025-06-27 v1 信号处理

摘要

多功能认知雷达系统中的时间分配问题重点关注扫描新出现目标与跟踪已检测目标之间的权衡。我们将其表述为多目标优化问题,并采用深度强化学习寻找 Pareto 最优解,同时比较了深度确定性策略梯度(DDPG)和软演员-评论家(SAC)算法。我们的结果表明,两种算法在适应各种场景方面均有效,其中与 DDPG 相比,SAC展现出更好的稳定性和样本效率。我们进一步采用 NSGA-II 算法来估计所考虑问题的 Pareto 前沿的上界。这项工作有助于开发更高效、更具适应性的认知雷达系统,使其能够在动态环境中平衡多个相互竞争的目标。

关键词

引用

@article{arxiv.2506.20853,
  title  = {Multi-Objective Reinforcement Learning for Cognitive Radar Resource Management},
  author = {Ziyang Lu and Subodh Kalia and M. Cenk Gursoy and Chilukuri K. Mohan and Pramod K. Varshney},
  journal= {arXiv preprint arXiv:2506.20853},
  year   = {2025}
}