中文

基于语义动态模型的安全强化学习视觉驱动 UAV 河流跟随

机器人学 2025-10-02 v2 人工智能

摘要

无人机的视觉驱动河流跟随对于救援、监视和环境监测等应用至关重要,尤其是在 GPS 信号不可靠的密集河流环境中。这些安全关键的导航任务必须满足硬约束,同时优化性能。此外,河流跟随的奖励本质上是历史依赖的(非马尔可夫的),即哪个河段已经被访问,这使得标准的安全强化学习(SafeRL)方法面临挑战。为此,我们提出了三个贡献。首先,我们引入了边际收益优势估计(Marginal Gain Advantage Estimation, MGAE),通过使用从历史回归中计算的滑动窗口基线来细化奖励优势函数,使优势估计与非马尔可夫动态相吻合。其次,我们开发了基于 patchified 水体语义掩码的语义动态模型(Semantic Dynamics Model, SDM),相对于潜在视觉动态模型提供更具解释性和数据高效的短期观察预测。最后,我们提出了受约束演员动态估计器架构(Constrained Actor Dynamics Estimator, CADE),将演员、成本估计器和 SDM 集成以进行成本优势估计,形成基于模型的 SafeRL 框架。仿真结果表明,MGAE 相对于诸如广义优势估计(Generalized Advantage Estimation)等传统基于评论家的方法实现了更快的收敛和卓越的性能。SDM 提供更准确的短期状态预测,使成本估计器能够更好地预测潜在违规。总体而言,CADE 有效地将安全法则集成到基于模型的强化学习中,拉格朗日方法在训练中提供“柔软”的奖励与安全平衡,而安全层在推理时通过施加“硬”动作叠加来增强安全性。

关键词

引用

@article{arxiv.2508.09971,
  title  = {Vision-driven River Following of UAV via Safe Reinforcement Learning using Semantic Dynamics Model},
  author = {Zihan Wang and Nina Mahmoudian},
  journal= {arXiv preprint arXiv:2508.09971},
  year   = {2025}
}

备注

Submitted to Robotics and Autonomous Systems (RAS) journal