针对随机最优控制与马尔可夫决策过程的贝叶斯复合风险方法
最优化与控制
2025-09-01 v3
摘要
受Shapiro等人\cite{shapiro2023episodic}启发,我们考虑随机最优控制(SOC)和马尔可夫决策过程(MDP),其中对信念不确定性和偶然不确定性所产生风险采用贝叶斯复合风险(BCR)度量(Qian等\cite{qian2019composite})。风险度量的时间依赖性允许及时捕获决策者(DM)在获取更多关于两种不确定性信息期望的动态风险偏好。这使得新的BCR-SOC/MDP模型比传统风险偏向的SOC/MDP模型更灵活。不同于\cite{shapiro2023episodic}在每个episode仅基于当前状态决定控制/动作的做法,新模型允许控制依赖于信念不确定性概率分布,这反映了在许多实际情况下,关于信念不确定性的累积信息常常影响DM对未来偶然不确定性的信念,从而影响DM的行动\cite{strens2000bayesian}。新建模范式包含了现有的各种SOC/MDP模型,包括分布式稳健SOC/MDP模型和Bayes适应MDP模型,并生成所谓的偏好稳健SOC/MDP模型。此外,我们推导了BCR-SOC/MDP模型良好定义的条件,展示了有限时域BCR-SOC/MDP模型可使用动态规划技术求解,并扩展讨论无限时域情况。通过Bellman方程,我们表明在某些标准条件下,随着episodic变量趋于无穷大,最优值和最优动作的渐近收敭性得以实现。最后,我们在有限时域赌盘问题和库存控制问题上进行数值测试,展示了所提出模型和数值方案的有效性。
引用
@article{arxiv.2412.16488,
title = {A Bayesian Composite Risk Approach for Stochastic Optimal Control and Markov Decision Processes},
author = {Wentao Ma and Zhiping Chen and Huifu Xu},
journal= {arXiv preprint arXiv:2412.16488},
year = {2025}
}