递归约束的部分可观测马尔可夫决策过程
人工智能
2024-06-06 v3 机器人学
摘要
许多序贯决策问题涉及优化一个目标函数同时对其他目标施加约束。约束部分可观测马尔可夫决策过程(C-POMDP)在转移不确定性与部分可观测性下对此建模。本工作中,我们首先证明 C-POMDP 在连续决策步上违背最优子结构性质,从而可能表现出对某些(如安全关键)应用不期望的行为。此外,C-POMDP 中的在线重规划常因该违背所致的不一致性而低效。为应对这些缺陷,我们引入递归约束 POMDP(RC-POMDP),其对 C-POMDP 施加额外的历史依赖代价约束。我们证明,与 C-POMDP 不同,RC-POMDP 总具有确定性最优策略,且最优策略遵从贝尔曼最优性原理。我们还给出了一种基于点的 RC-POMDP 动态规划算法。在基准问题上的评估展示了我们算法的有效性,并表明 RC-POMDP 策略产生比 C-POMDP 策略更可取的行为。
引用
@article{arxiv.2310.09688,
title = {Recursively-Constrained Partially Observable Markov Decision Processes},
author = {Qi Heng Ho and Tyler Becker and Benjamin Kraske and Zakariya Laouar and Martin S. Feather and Federico Rossi and Morteza Lahijanian and Zachary N. Sunberg},
journal= {arXiv preprint arXiv:2310.09688},
year = {2024}
}
备注
Accepted to the Conference on Uncertainty in Artificial Intelligence (UAI) 2024