中文

连续时间中的 q-学习

机器学习 2025-05-07 v4 人工智能 计算金融

摘要

我们研究由 Wang 等人 (2020) 提出的熵正则化探索性扩散过程表述下强化学习(RL)的 Q-学习的连续时间对应形式。由于常规的(大)Q-函数在连续时间中坍缩,我们考虑其一阶近似并创用术语“(小)q-函数”。该函数与瞬时优势率函数以及哈密顿量相关。我们围绕 q-函数建立了独立于时间离散化的“q-学习”理论。给定随机策略,我们在同策略与异策略两种设定下,通过某些随机过程的鞅条件联合刻画了相应的 q-函数与值函数。我们随后将该理论应用于设计不同的 actor-critic 算法来求解底层 RL 问题,具体取决于能否显式计算由 q-函数生成的 Gibbs 测度的密度函数。我们的一个算法诠释了著名的 Q-学习算法 SARSA,另一个恢复了 Jia 与 Zhou (2022b) 提出的基于策略梯度(PG)的连续时间算法。最后,我们开展仿真实验,将我们的算法与 Jia 和 Zhou (2022b) 中基于 PG 的算法以及时间离散化的常规 Q-学习算法进行性能比较。

关键词

引用

@article{arxiv.2207.00713,
  title  = {q-Learning in Continuous Time},
  author = {Yanwei Jia and Xun Yu Zhou},
  journal= {arXiv preprint arXiv:2207.00713},
  year   = {2025}
}

备注

70 pages, 4 figures, appended with an erratum