随机最小成本到达-避免型强化学习
机器学习
2026-05-19 v2
摘要
我们研究了随机最小成本到达-避免型强化学习,其中智能体必须以至少概率 满足到达-避免规范,同时最小化随机环境中的预期累积成本。现有的安全和受约束强化学习方法通常无法在随机环境中的学习设置下联合强制执行概率到达-避免约束和优化成本。为解决这一挑战,我们引入了到达-避免概率证书 (RAPC),这些证书识别满足随机到达-避免约束的状态。基于 RAPC,我们发展了一种基于收缩的 Bellman 公式,作为将到达-避免考虑纳入强化学习的原则性替代方案,使成本优化能够在概率约束下实现。我们建立了所提出算法在几乎确定性意义上收敛到局部最优策略的证明。MuJoCo 模拟器中的实验表明,方法在改进成本性能方面表现更好,且 consistently 实现更高的到达-避免满足率。
引用
@article{arxiv.2605.11975,
title = {Stochastic Minimum-Cost Reach-Avoid Reinforcement Learning},
author = {Jingduo Pan and Taoran Wu and Yiling Xue and Bai Xue},
journal= {arXiv preprint arXiv:2605.11975},
year = {2026}
}
备注
Accepted at the Forty-third International Conference on Machine Learning (ICML 2026)