在状态-动作空间中用无记忆随机策略求解无限时域 POMDP
机器学习
2022-05-30 v1 系统与控制
系统与控制
最优化与控制
摘要
在完全可观测马尔可夫决策过程中,奖励优化等价于在状态-动作频率多面体上的线性规划。在具有无记忆随机策略的部分可观测马尔可夫决策过程中采取类似视角,该问题近来被表述为受多项式约束的线性目标优化。基于此,我们提出一种状态-动作空间奖励优化(ROSA)方法。我们在迷宫导航任务中对该方法进行了实验测试。我们发现 ROSA 计算高效,且能较其他现有方法取得稳定性改进。
引用
@article{arxiv.2205.14098,
title = {Solving infinite-horizon POMDPs with memoryless stochastic policies in state-action space},
author = {Johannes Müller and Guido Montúfar},
journal= {arXiv preprint arXiv:2205.14098},
year = {2022}
}
备注
Accepted as an extended abstract at RLDM 2022, 5 pages, 2 figures