面向平均场控制问题的连续时间 q-learning
机器学习
2024-11-04 v4 最优化与控制
计算金融
摘要
本文研究 Jia 与 Zhou(2023)近期提出的、作为 Q-learning 连续时间对应物的 q-learning,用于熵正则化强化学习设定下的连续时间 Mckean-Vlasov 控制问题。与 Jia 和 Zhou(2023)中单智能体控制问题不同,智能体的平均场相互作用使得 q-函数的定义更为微妙,我们揭示出自然产生两种不同的 q-函数:(i)积分 q-函数(记为 ),作为 Gu、Guo、Wei 与 Xu(2023)所引入积分 Q-函数的一阶近似,可通过涉及测试策略的弱鞅条件学习;以及(ii)本质 q-函数(记为 ),用于策略改进迭代。我们表明,在全部测试策略下,两个 q-函数经由积分表示相关联。基于弱鞅条件与我们提出的测试策略搜索方法,设计了若干无模型学习算法。在两个示例中——一个在 LQ 控制框架下,一个超出 LQ 控制框架——我们可得到最优值函数与 q-函数的精确参数化,并通过仿真实验说明我们的算法。
引用
@article{arxiv.2306.16208,
title = {Continuous-time q-learning for mean-field control problems},
author = {Xiaoli Wei and Xiang Yu},
journal= {arXiv preprint arXiv:2306.16208},
year = {2024}
}
备注
Keywords: Continuous-time reinforcement learning, integrated q-function, mean-field control, weak martingale characterization, test policies