中文

部分可观测下安全关键控制的动作条件风险门控

机器学习 2026-05-15 v1 人工智能 系统与控制 系统与控制

摘要

许多安全关键控制问题被建模为风险敏感部分可观测马尔可夫决策过程,其中控制器必须在任务性能与安全风险之间取得平衡的同时,基于不完整的观测做出决策。尽管信念空间规划提供了有原理的解决方案,但在实际领域中,信念的维护与规划可能计算成本高昂且对模型设定敏感。我们提出了一种轻量级的风险门控强化学习近似方法,用于解决部分可观测下的风险敏感控制。该方法构建了一个紧凑的有限历史代理状态,并学习了一个动作条件的近期安全违规预测器。这种预测的候选动作风险以两种互补的方式使用:作为价值学习期间的风险惩罚,以及作为在乐观和保守的集成价值估计之间进行插值的决策时门控。因此,低风险动作的评估更接近寻奖估计,而高风险动作的评估则更为保守。我们在两个安全关键的部分可观测领域中评估了该方法:自动血糖调节和安全约束导航。在成人和青少年血糖控制队列中,该方法改善了整体血糖权衡,并且与信念空间规划基线相比大幅减少了运行时间。在 Safety-Gym 导航基准上,与无约束强化学习和几种标准的安全强化学习基线相比,它实现了更有利的奖励-成本平衡。这些结果表明,当完整的信念空间规划不可行时,动作条件的近期风险可以为近似风险敏感 POMDP 控制提供有效的局部信号。

关键词

引用

@article{arxiv.2605.14246,
  title  = {Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability},
  author = {Yushen Liu and Yin-Jen Chen and Ziyi Chen and Tao Wang and Heng Huang and Xugui Zhou and Yanfu Zhang},
  journal= {arXiv preprint arXiv:2605.14246},
  year   = {2026}
}