针对随机最优控制与马尔可夫决策过程的贝叶斯复合风险方法
计算与语言
2024-12-24 v1 计算机与社会
机器学习
社会与信息网络
摘要
受Shapiro等人\cite{shapiro2023episodic}启发,我们考虑随机最优控制(SOC)和马尔可夫决策过程(MDP),其中风险来自信念不确定性和随机性不确定性,使用贝叶斯复合风险(BCR)度量(Qian等\cite{qian2019composite})。度量的时间依赖性允许我们妥善捕捉决策者(DM)在获取双重不确定性信息过程中的动态风险偏好。这种新的BCR-SOC/MDP模型比传统风险对抗SOC/MDP模型更灵活。不同于\cite{shapiro2023episodic}在每个剂集仅基于当前状态决定控制/动作,新模型允许控制依赖于信念不确定性的概率分布,这反映了在许多实际情况下,关于信念不确定性的累积信息常常影响DM对未来随机性不确定性的信念,从而影响DM的行动\cite{strens2000bayesian}。新的建模范式包括现有的SOC/MDP模型,如分布式鲁棒SOC/MDP模型和贝叶斯自适应MDP模型,并生成所谓的偏好鲁棒SOC/MDP模型。此外,我们推导了BCR-SOC/MDP模型良好定义的条件,说明有限时序BCR-SOC/MDP模型可使用动态规划技术求解,并扩展讨论到无限时序情况。通过贝尔曼方程,我们表明在某些标准条件下,随着剂集变量趋于无穷,最优值和最优动作的渐近收敭性得以实现。最后,我们在有限时序赌注问题和库存控制问题上进行数值测试,展示了所提出模型和数值方案的有效性。
引用
@article{arxiv.2412.16486,
title = {Evaluating the Performance of Large Language Models in Scientific Claim Detection and Classification},
author = {Tanjim Bin Faruk},
journal= {arXiv preprint arXiv:2412.16486},
year = {2024}
}