中文

最小化多机器人持续监测的最坏情况加权延迟:理论与基于强化学习的求解方法

机器人学 2026-05-12 v1 系统与控制 系统与控制

摘要

我们研究加权图上的多机器人持续监测问题,其中节点权重编码监测优先级,边权重编码移动距离。目标是设计联合机器人轨迹,以最小化无限时间视界内所有节点的最坏情况加权延迟。广泛采用的最坏情况延迟目标在整个时间视界上评估团队性能,因此可能无法区分具有较差瞬态行为但具有强渐近性能的策略。为解决这一局限性,我们提出了一类尾部性能目标,推广了标准目标,并研究了由此产生的泛函优化问题。我们建立了几个关键的理论性质,包括最优策略的存在性、所提出目标及其对应优化问题之间的关系、通过周期性解的任意精度逼近,以及向具有离散等待时间的事件驱动决策模型的归约。基于这些结果,我们构建了一个等价的事件驱动 Markov 决策过程 (MDP),称为尾部最坏情况延迟优化 Markov 决策过程 (TWLO-MDP),将尾部性能目标重新表述为标准的平均奖励准则。随后,我们开发了基于强化学习的 TWLO-MDP 求解方法,并引入了多机器人监测基准 (M2Bench),这是一个支持评估和比较启发式与基于学习的监测算法的统一平台。在合成和真实监测场景上的实验表明,我们的方法有效降低了最坏情况加权延迟,并优于代表性基线。

关键词

引用

@article{arxiv.2605.09633,
  title  = {Minimizing Worst-Case Weighted Latency for Multi-Robot Persistent Monitoring: Theory and RL-Based Solutions},
  author = {Weizhen Wang and Ziheng Wang and Jianping He and Xinping Guan and Xiaoming Duan},
  journal= {arXiv preprint arXiv:2605.09633},
  year   = {2026}
}