高斯混合模型 Q 函数在强化学习中的策略迭代
机器学习
2025-12-23 v1
摘要
与在强化学习中常作为概率密度函数估计器的传统用途不同,本文提出了一种新颖的函数逼近角色,将高斯混合模型(GMM)直接用作 Q 函数损失的替代器。这些参数化模型称为 GMM-QF,拥有巨大的表示能力,证明其在广泛函数类别上是通用逼近器。进一步地,它们被嵌入 Bellman 残差中,其可学习参数——固定数量的混合权重、以及高斯均值向量和协方差矩阵——通过在黎曼流形上进行优化从数据中推断得出。这种对参数空间的几何视角自然地将黎曼优化集成到标准策略迭代框架的策略评估步骤中。建立了严格的理论结果,支持性数值测试表明,即使没有经验数据,GMM-QF 仍能在多种基准 RL 任务中提供具竞争力的性能,甚至在某些情况下超过最先进的方法,同时显著降低了深度学习方法(依赖经验数据)的计算开销。
引用
@article{arxiv.2512.18763,
title = {Gaussian-Mixture-Model Q-Functions for Policy Iteration in Reinforcement Learning},
author = {Minh Vu and Konstantinos Slavakis},
journal= {arXiv preprint arXiv:2512.18763},
year = {2025}
}
备注
This work has been submitted to the IEEE for possible publication