中文

安全值函数

系统与控制 2024-06-10 v4 机器学习 机器人学 系统与控制

摘要

安全约束与最优性对于控制器而言重要,但有时相互冲突。尽管这些准则通常借助不同工具分开求解以维持形式化保证,但在强化学习中常见的做法是通过惩罚失败来简单修改奖励函数,而将惩罚仅视为一种启发式手段。我们严格考察了安全性、最优性与惩罚之间的关系,并形式化了安全值函数(SVFs)的充分条件:即对于给定的任务是最优的,且能强制执行安全约束的值函数。我们通过考察在最优控制下奖励何时保持可行性来揭示这一结构,并证明总存在一个有限惩罚能诱导出安全值函数。该惩罚并不唯一,但具有上无界性:更大的惩罚不会损害最优性。尽管通常无法计算出所需的最小惩罚,我们揭示了惩罚、奖励、折扣因子与动力学之间相互作用的清晰结构。这一洞见为在安全至关重要的控制问题中设计奖励函数提供了实用的、由理论引导的启发式方法。

关键词

引用

@article{arxiv.2105.12204,
  title  = {Safe Value Functions},
  author = {Pierre-François Massiani and Steve Heim and Friedrich Solowjow and Sebastian Trimpe},
  journal= {arXiv preprint arXiv:2105.12204},
  year   = {2024}
}

备注

16 pages, 6 figures. Accepted for publication in: Transactions of Automatic Control, special issue on Learning and Control