中文

C-STEP:面向移动代理的连续空间-时间物理信息安全强化学习

系统与控制 2026-03-26 v1 机器学习 系统与控制

摘要

在复杂环境中进行安全导航是强化学习 (RL) 在机器人领域的核心挑战。本文引入了连续空间-时间赋能 (C-STEP) 用于物理信息安全强化学习,一种针对确定性、连续领域的代理中心化安全度量。该度量可用于通过增强正向导航奖励函数来设计物理信息感知的内在奖励。该奖励包含代理的内部状态(如初始速度)和前向动力学,以区分安全行为与风险行为。通过将 C-STEP 与导航奖励集成,我们获得了一个联合优化任务完成与碰撞避免的内在奖励函数。数值结果表明,碰撞次数减少,靠近障碍物程度降低,旅行时间仅略有增加。总体而言,C-STEP 提供了一种可解释的、基于物理信息的强化学习奖励塑造方法,促进了代理式移动机器人系统的安全。

引用

@article{arxiv.2603.24241,
  title  = {C-STEP: Continuous Space-Time Empowerment for Physics-informed Safe Reinforcement Learning of Mobile Agents},
  author = {Guihlerme Daubt and Adrian Redder},
  journal= {arXiv preprint arXiv:2603.24241},
  year   = {2026}
}