关于观测扰动下 POMDP 策略鲁棒性的分析
人工智能
2026-04-24 v1
摘要
部分可观测马尔可夫决策过程(POMDP)的策略通常使用 nominal 系统模型进行设计。然而,在实际部署过程中,这一模型可能偏离真实系统,从而导致意外的性能降级。本工作研究策略对 POMDP 观测模型偏差的鲁棒性。我们引入 "策略观测鲁棒性问题":确定 POMDP 观测模型可容忍的最大偏差,以保证策略的价值保持在指定阈值以上。我们分析了两个变体:sticky 变体,其中偏差取决于状态和动作;non-sticky 变体,其中偏差可以是 history-dependent 的。我们表明,策略观测鲁棒性问题可形式化为一个双层优化问题,其中内层优化对观测偏差大小是单调的。这使得使用根寻数算法求解外层优化成为高效。对于 non-sticky 变体,我们表明,当策略以有限状态控制器(FSC)表示时,仅需考虑依赖于 FSC 节点而非完整历史的观测即可。我们提出了一种具有正确性和收敛性保证的算法 Robust Interval Search(鲁棒区间搜索),适用于 sticky 和 non-sticky 两个变体。我们展示该算法在 non-sticky 变体中具有多项式时间复杂度,而在 sticky 变体中最多具有指数时间复杂度。我们提供实验结果,验证并展示了 Robust Interval Search 在解决具有数万个状态的 POMDP 问题时实现的可扩展性。我们还提供了来自机器人和运营研究的案例研究,展示了该问题和算法的实际实用性。
引用
@article{arxiv.2604.21256,
title = {Robustness Analysis of POMDP Policies to Observation Perturbations},
author = {Benjamin Kraske and Qi Heng Ho and Federico Rossi and Morteza Lahijanian and Zachary Sunberg},
journal= {arXiv preprint arXiv:2604.21256},
year = {2026}
}
备注
43 Pages