中文

完全可观测非确定性问题中状态安全性决定算法:技术报告

人工智能 2026-03-17 v1

摘要

学习的动作策略在顺序决策中日益受到青睐,但缺乏安全保证。最近的工作引入了用于测试此类策略在初始状态和动作结果非确定性下的安全性的管道。其核心是决定一个状态是否安全(是否存在从该状态可达的安全策略)以及寻找故障的问题——即从安全状态出发导致不安全状态的状态-动作对。他们最有效的安全决策算法 TarjanSafe 在基准测试中表现良好,但我们指出其相对于状态空间具有指数级最坏运行时间。已存在一种线性时间算法,但在实际中较慢。我们通过一种新的策略迭代算法 iPI 弥合了这一差距:它兼具两者优势:在最佳情况下匹配 TarjanSafe 的运行时间,同时保证多项式最坏情况。实验确认了我们的理论,在适合 TarjanSafe 的问题中,iPI 与之性能相似;而在不适合的场景中,iPI 扩展性更好。

关键词

引用

@article{arxiv.2603.15282,
  title  = {Algorithms for Deciding the Safety of States in Fully Observable Non-deterministic Problems: Technical Report},
  author = {Johannes Schmalz and Chaahat Jain},
  journal= {arXiv preprint arXiv:2603.15282},
  year   = {2026}
}