POMDP 中的历史依赖评估
最优化与控制
2020-04-21 v1
摘要
我们考虑一类部分可观察马尔可夫决策过程(POMDP),其中阶段收益的权重取决于无限重复问题中过去发生的信号和动作序列。我们证明,对于所有 epsilon>0,存在一个策略,该策略对于任何满足“决策者足够耐心”这一性质的权重序列都是 epsilon-最优的。这统一并推广了文献中的若干结果,尤其适用于具有 limsup 收益的 POMDP。
引用
@article{arxiv.2004.08844,
title = {History-dependent evaluations in POMDPs},
author = {Xavier Venel and Bruno Ziliotto},
journal= {arXiv preprint arXiv:2004.08844},
year = {2020}
}