基于稀疏高斯混合模型 Q 函数的在线强化学习
机器学习
2026-02-17 v3 最优化与控制
摘要
本文引入一种基于稀疏高斯混合模型 Q 函数 (S-GMM-QF) 的结构化且可解释的在线策略迭代框架,用于强化学习 (RL)。该框架延续了之前在离线训练 GMM-QF 的工作,发展出一种利用流式数据来鼓励探索的在线方案。通过哈达德过参数化实现稀疏化,以调节模型复杂度,缓解过拟合的同时保持表达能力。S-GMM-QF 的参数空间天然具备黎曼流形结构,允许基于光滑目标函数进行在线梯度下降的原则性参数更新。数值实验表明,S-GMM-QF 在标准基准测试上表现出与甚至优于稠密深度强化学习 (DeepRL) 方法,同时显著减少参数数量。此外,即便在稀疏化深度强化学习方法难以泛化的低参数 regime 下,S-GMM-QF 也能保持强性能。
引用
@article{arxiv.2509.14585,
title = {Online reinforcement learning via sparse Gaussian mixture model Q-functions},
author = {Minh Vu and Konstantinos Slavakis},
journal= {arXiv preprint arXiv:2509.14585},
year = {2026}
}