中文

无安全典征模型逼近安全反馈:基于模型预测控制

机器学习 2026-05-26 v2 机器人学

摘要

移动机器人安全决策算法通常需要存在反馈来验证所提议动作的安全性。这种反馈在开发或部署控制系统时被假设为直接可用。它可以形式化为显式约束 formulation 或一组手工标注的安全数据,两者都可能不准确或耗时。许多最近开发的模拟器能够处理复杂的相互作用和多样化环境。这些环境具有隐式安全约束,可能难以建模。通过利用这些模拟器,我们可以构建一个安全函数的代理,从而绕过手工设计反馈来捕获这些约束。我们提出了一种算法,通过可逆性和对不安全状态空间的正不变性假设来逼近安全性。该方法采用模型预测路径积分算法(MPPI)来建立这种可逆性并验证所提议的动作。首先通过模拟器将动作投影到未来状态。然后如果 MPPI 能找到一条返回��迹中先前状态的路径,则该状态被保证在不安全(正不变)集合之外。实验结果表明,所提出的算法能够在避免将不安全状态分类为安全状态的同时,逼近安全典征的性能。

关键词

引用

@article{arxiv.2510.20955,
  title  = {Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control},
  author = {Jeff Pflueger and Michael Everett},
  journal= {arXiv preprint arXiv:2510.20955},
  year   = {2026}
}

备注

8 pages, 5 figures