中文

递归约束的部分可观测马尔可夫决策过程

人工智能 2024-06-06 v3 机器人学

摘要

许多序贯决策问题涉及优化一个目标函数同时对其他目标施加约束。约束部分可观测马尔可夫决策过程(C-POMDP)在转移不确定性与部分可观测性下对此建模。本工作中,我们首先证明 C-POMDP 在连续决策步上违背最优子结构性质,从而可能表现出对某些(如安全关键)应用不期望的行为。此外,C-POMDP 中的在线重规划常因该违背所致的不一致性而低效。为应对这些缺陷,我们引入递归约束 POMDP(RC-POMDP),其对 C-POMDP 施加额外的历史依赖代价约束。我们证明,与 C-POMDP 不同,RC-POMDP 总具有确定性最优策略,且最优策略遵从贝尔曼最优性原理。我们还给出了一种基于点的 RC-POMDP 动态规划算法。在基准问题上的评估展示了我们算法的有效性,并表明 RC-POMDP 策略产生比 C-POMDP 策略更可取的行为。

关键词

引用

@article{arxiv.2310.09688,
  title  = {Recursively-Constrained Partially Observable Markov Decision Processes},
  author = {Qi Heng Ho and Tyler Becker and Benjamin Kraske and Zakariya Laouar and Martin S. Feather and Federico Rossi and Morteza Lahijanian and Zachary N. Sunberg},
  journal= {arXiv preprint arXiv:2310.09688},
  year   = {2024}
}

备注

Accepted to the Conference on Uncertainty in Artificial Intelligence (UAI) 2024