中文

基于强化学习的轴向-only 跟踪观察者控制

人工智能 2026-05-05 v1

摘要

本文发展基于深度强化学习的观察者控制策略,用于移动目标的轴向-only 跟踪。观察者机动问题被建模为信念马尔可夫决策过程,其中信念状态由 cubature 卡尔曼滤波器 (CKF) 的后验分布表示。奖励函数旨在解决两个相互冲突的目标:最小化绝对目标位置估计误差 (欧几里得距离) 和维持 CKF 估计一致性 (马氏距离)。奖励在两者的 Pareto 前沿上进行几何插值,由权重因子 β[0,1]\beta \in [0,1] 参数化。该策略实现为深度 Q 网络 (DQN),在 50,000 个 episode 上训练。性能在 5,000 个蒙特卡洛 episode 上评估,并与两个基线比较:垂直于轴向的启发式方法和 D 最优 Fisher 信息最大化准则。结果表明,在 β=0.7\beta = 0.7 时的 DQN 策略在准确性和鲁棒性之间取得最佳权衡:它在均值跟踪准确性上匹配信息论基线,同时将最坏情况误差降低了近十倍,归功于马氏项在奖励中对隐式滤波一致性正则化的贡献。

关键词

引用

@article{arxiv.2605.02120,
  title  = {Reinforcement Learning Trained Observer Control for Bearings-Only Tracking},
  author = {Branko Ristic and Sanjeev Arulampalam},
  journal= {arXiv preprint arXiv:2605.02120},
  year   = {2026}
}

备注

7 pages, 2 figures, 3 tables