量子马尔可夫决策过程:用于最优解的动态与半定规划
量子物理
2025-02-24 v2 系统与控制
系统与控制
最优化与控制
摘要
在本文中,基于我们先前工作 [{\sc N.~Saldi, S.~Sanjari, and S.~Y"{u}ksel}, {\em Quantum Markov Decision Processes: General Theory, Approximations, and Classes of Policies}, SIAM Journal on Control and Optimization, 2024] 中提出的量子马尔可夫决策过程(q-MDP)的表述,我们的重点转向为开环和经典状态保持闭环策略的最优策略与值函数开发半定规划方法。首先,通过利用任意具有开环策略的 q-MDP 的动态规划与半定规划表述之间的对偶性,我们证明了最优值函数是线性的,并且在开环策略中存在平稳最优策略。然后,利用这些结果,我们建立了一种计算近似最优值函数的方法,并将最优平稳开环策略的计算表述为一个双线性规划。接下来,我们将注意力转向经典状态保持闭环策略。建立了经典状态保持闭环策略的动态规划和半定规划表述,其中这两种表述的对偶性同样使我们能够证明最优策略是线性的,并且存在最优平稳经典状态保持闭环策略。然后,与开环情况类似,我们建立了一种计算最优值函数的方法,并将最优平稳经典状态保持闭环策略的计算表述为一个双线性规划。
关键词
引用
@article{arxiv.2402.14651,
title = {Quantum Markov Decision Processes: Dynamic and Semi-Definite Programs for Optimal Solutions},
author = {Naci Saldi and Sina Sanjari and Serdar Yuksel},
journal= {arXiv preprint arXiv:2402.14651},
year = {2025}
}
备注
53 pages