大类 POMDP 无需未来记忆
最优化与控制
2022-05-06 v1
摘要
部分可观测马尔可夫决策过程(POMDPs)的最优策略依赖于历史:决策基于完整的观测历史。仅基于最近一次观测做出决策的无记忆策略,在文献中通常被认为无用,因为我们可以构造出这样的 POMDP 实例,其最优无记忆策略比依赖历史的策略差得任意多。我们的目的是挑战这一看法。我们证明,最优无记忆策略可通过混合整数线性规划(MILP)高效计算,并且在文献中的大量实例上表现相当良好。当用有效不等式加强后,该 MILP 的线性松弛为最优依赖历史策略的值提供了高质量上界。此外,当以有限时域 POMDP 问题结合无记忆策略作为滚动优化问题时,模型预测控制方法可导出一种高效的依赖历史策略,我们称之为未来短记忆(SMF)策略。本质上,SMF 策略利用这些无记忆策略来构建贝尔曼值函数的近似。数值实验显示了我们的方法在文献基准实例上的高效性。
引用
@article{arxiv.2205.02580,
title = {Future memories are not needed for large classes of POMDPs},
author = {Victor Cohen and Axel Parmentier},
journal= {arXiv preprint arXiv:2205.02580},
year = {2022}
}
备注
arXiv admin note: text overlap with arXiv:2012.00645