中文

并发随机可达性与安全性博弈上值迭代的停止准则

计算机科学中的逻辑 2025-09-11 v2 人工智能 多智能体系统

摘要

我们考虑在图上进行的具有可达性和安全性目标的二人零和并发随机博弈(CSG)。其中包括诸如马尔可夫决策过程或回合制随机博弈等退化类,它们可以通过线性或二次规划求解;然而在实践中,值迭代(VI)优于其他方法且是实现最多的方法。类似地,对于 CSG,这种实际性能使得 VI 成为通过实数存在理论的标准理论解法的一种极具吸引力的替代方案。VI 从每个状态所求值的欠逼近开始并迭代更新它们,传统上在连续两次逼近达到 ϵ\epsilon-接近时终止。然而,这种停止准则缺乏对逼近精度的保证,而这正是本文工作的目标。我们为 CSG 提供了有界(又称区间)VI:它用收敛的过逼近序列来补充标准 VI,并在过逼近与欠逼近达到 ϵ\epsilon-接近时终止。

关键词

引用

@article{arxiv.2505.21087,
  title  = {Stopping Criteria for Value Iteration on Concurrent Stochastic Reachability and Safety Games},
  author = {Marta Grobelna and Jan Křetínský and Maximilian Weininger},
  journal= {arXiv preprint arXiv:2505.21087},
  year   = {2025}
}

备注

Full version of the corresponding LICS'25 paper Corrected Algorithm 2 and associated Lemma 30