中文

面向安全关键场景的动态残差安全强化学习框架

机器人学 2025-04-10 v1

摘要

在安全关键场景中,传统的自动驾驶框架面临在安全约束与任务性能之间取得平衡的重大挑战。这些框架在实时量化动态相互作用风险方面困难,过度依赖手动规则,导致计算效率低下和保守的策略。为此,我们提出一种基于安全增强网络马尔可夫决策过程的动态残差安全强化学习(DRS-RL)框架。这是首次将弱到强理论引入多智能体决策中,使其能够通过弱到强安全纠正范式实现轻量级动态校准安全边界。基于多智能体动态冲突区模型,我们的框架准确捕捉了异构交通参与者之间的时空耦合风险,超越了常规几何规则的静态约束。此外,一种风险感知的优先级经验回放机制通过将风险映射到采样概率来缓解数据分布偏差。实验结果表明,所提方法在安全性、效率和舒适性方面显著优于传统强化学习算法。具体而言,它将碰撞率降低了最高可达 92.17%,而安全模型仅占主模型参数的 27%。

关键词

引用

@article{arxiv.2504.06670,
  title  = {Dynamic Residual Safe Reinforcement Learning for Multi-Agent Safety-Critical Scenarios Decision-Making},
  author = {Kaifeng Wang and Yinsong Chen and Qi Liu and Xueyuan Li and Xin Gao},
  journal= {arXiv preprint arXiv:2504.06670},
  year   = {2025}
}