中文

具有可达性目标不完全偏好的随机系统中的机会主义定性规划

人工智能 2022-10-06 v1 计算机科学与博弈论 机器人学 系统与控制 系统与控制

摘要

当无法同时满足所有约束时,偏好在决定应满足哪些目标/约束方面起着关键作用。本文研究在随机系统(建模为 MDP)中,给定关于时序扩展目标的(可能不完整的)组合偏好模型,如何综合满足偏好的规划。我们首先引入新的语义来解释随机系统无限博弈上的偏好。然后,我们引入一种称为改进(improvement)的新概念,以便对无限博弈的两个前缀进行比较。基于此,我们定义两个解概念:安全且正改进(SPI)和安全且几乎必然改进(SASI),分别以保证正概率和概率为 1 的改进。我们构建了一个称为改进 MDP 的模型,其中保证至少一次改进的 SPI 和 SASI 策略的综合归结为在 MDP 中计算正赢和几乎必然赢策略。我们提出一种算法来综合引发多次顺序改进的 SPI 和 SASI 策略。我们使用一个机器人运动规划问题展示了所提出的方法。

关键词

引用

@article{arxiv.2210.01878,
  title  = {Opportunistic Qualitative Planning in Stochastic Systems with Incomplete Preferences over Reachability Objectives},
  author = {Abhishek N. Kulkarni and Jie Fu},
  journal= {arXiv preprint arXiv:2210.01878},
  year   = {2022}
}

备注

7 pages, 3 figures, under review for IEEE ACC 2023