有限可加评估下的马尔可夫决策过程中的最优策略
最优化与控制
2026-03-05 v1 理论经济学
摘要
我们研究无限时限马尔可夫决策过程(MDP),其中决策者通过聚合所有阶段期望奖励的无限序列来评估其策略。我们方法的关键特征在于,使用给定的 diffuse charge(在阶段集合上的一种 diffuse 可加概率测度)对聚合进行处理。在该设置下,Neyman [2023] 的结果表明,在每个具有有限状态和动作空间的 MDP 中,只要 diffuse charge 满足货币时间价值原则,决策者就存在纯策略最优解。他的结果引出了一个问题:在聚合 charge 附加额外假设的情况下,是否存在最优策略?我们以反例回答此问题,给出一种精心构建的聚合 charge,使得该 MDP 完全不存在最优策略,无论是纯策略还是随机化策略。
引用
@article{arxiv.2603.04226,
title = {Optimal strategies in Markov decision processes with finitely additive evaluations},
author = {János Flesch and Arkadi Predtetchinski and William D Sudderth and Xavier Venel},
journal= {arXiv preprint arXiv:2603.04226},
year = {2026}
}