受约束强化学习的随机决策时限
机器学习
2026-05-27 v2
摘要
我们提出了随机决策时限(SDH),这是一个在强化学习中解决每一步约束满足问题的理论框架,这在许多实际应用中都是可取的贡属性。在 SDH 中,约束违反会导致通过状态-动作继续概率实现有效的时限缩短。借助 Control as Inference,我们发展了第一个无偏且正则化的 RL 算法,以处理即时约束。我们确定了两种原则语义来界定何为决策:吸收状态语义结束决策过程,因此只有存活的决策支付熵成本,从而产生 max-entropy AS-SAC;虚拟终止保持决策过程持续,但停止奖励信用,从而产生 KL 正则化 VT-MPO。为将 SDH 与 CMDP 联系起来,我们跟踪沿轨迹积累的违规深度轮廓。SDH 通过指数加权每个轨迹的总违规深度来有效处理;这在违规仅在单个特征尺度上发生时,恰好匹配加法 CMDP 预算;我们指出了当稀有、深层违规混合频繁、浅层违规时的情况。实验验证了该理论。在 90 肌肉的 H2190 人类机器人(Hyfydy)上,VT-MPO 以 4 倍更少的环境步骤和更稳定的训练匹配最先进的步态真实性。在 Safety Gymnasium 上,违规深度轮廓正确识别了 SDH 提供强烈奖励-违规权衡的 regime。
引用
@article{arxiv.2602.04599,
title = {Stochastic Decision Horizons for Constrained Reinforcement Learning},
author = {Nikola Milosevic and Leonard Franz and Daniel Haeufle and Georg Martius and Nico Scherf and Pavel Kolev},
journal= {arXiv preprint arXiv:2602.04599},
year = {2026}
}