基于 Sarsa 和 Q-learning 的异构智能目标跟踪索引策略
系统与控制
2024-02-20 v1 机器学习
系统与控制
摘要
在解决主动与被动雷达网络内多智能目标跟踪的非贪婪雷达调度问题时,我们需要兼顾短期增强的跟踪性能以及主动跟踪下未来目标机动的更高概率。在调度主动和被动雷达的波束资源时获取长期跟踪性能是一个挑战。为应对这一挑战,我们将该问题建模为由并行 restless 老虎机过程组成的马尔可夫决策过程。每个老虎机过程关联一个智能目标,其估计状态根据不同的动作(是否正在跟踪目标)遵循不同的离散动态模型演化。离散状态由动态模式定义。该问题表现出维数灾难,最优解通常是难以处理的。我们借助著名的 restless 多臂老虎机技术诉诸启发式方法。由此产生了基于索引的高效调度策略,这些索引是代表采取不同动作的边际奖励的实数。针对转移矩阵未知的不可避免的实际案例,我们提出了一种新方法,利用前向 Sarsa 和后向 Q-learning,通过调整状态 - 动作值函数(或等价地 Q 函数)来近似索引,并提出了一种旨在最大化长期跟踪奖励的新策略,即 ISQ。数值结果表明,所提出的 ISQ 策略优于传统的基于 Q-learning 的方法,并迅速收敛到具有已知状态转移模型的著名 Whittle 索引策略(被视为基准)。
引用
@article{arxiv.2402.12015,
title = {An Index Policy Based on Sarsa and Q-learning for Heterogeneous Smart Target Tracking},
author = {Yuhang Hao and Zengfu Wang and Jing Fu and Quan Pan},
journal= {arXiv preprint arXiv:2402.12015},
year = {2024}
}
备注
11 pages