中文

连续时间 q 学习:带共通噪声的均场控制问题 II:q 学习算法

广义相对论与量子宇宙学 2026-05-15 v2

摘要

本文是 Ren 等人 (2026) 工作的延续,旨在进一步制定针对带受控共通噪声的均场控制 (MFC) 的 q 学习算法。基于松弛控制形式,我们首先通过评估所有测试政策生成的条件状态分布沿所得的价值函数和 Iq 函数的鞅条件。由于松弛控制形式中的数据在实际中不可观测,我们量化了在探索性形式下用可观测数据替换的误差。在离散采样动作的情况下,评估了这种误差。结合 Ren 等人 (2026) 中最优政策的两层固定点表述,我们提出了若干算法,包括 Actor-Critic q 学习算法,其中政策在 Actor 步骤中依据改进后的 Iq 函数迭代规则进行更新,价值函数和 Iq 函数则依据鞅正交性条件使用探索性形式的数据进行 Critic 步骤的更新。我们也在无限时域线性-二次 (LQ) 框架下证明了 Actor 步骤中内部迭代的收敛性。在两个示例中,在 LQ 框架内外,我们的 q 学习算法均以令人满意的性能实现。

关键词

引用

@article{arxiv.2604.27377,
  title  = {Bound-State Resonances of Schwarzschild-de Sitter Black Holes: Analytic Treatment},
  author = {Qi-Dong Chen and Chong-Bin Chen and Guo-Qing Huang and Fu-Wen Shu and Tieguang Zi},
  journal= {arXiv preprint arXiv:2604.27377},
  year   = {2026}
}

备注

15 pages, 1 figure. V2: Revised Sec. V , removed one figure and added Sec. VII