基于结构可最大化 Q 函数的无演员连续控制
机器学习
2025-10-23 v1 人工智能
机器人学
机器学习
摘要
基于价值的方法是基于离策略强化学习的基石,因其简单性和训练稳定性而受到青睐。然而,这些方法传统上仅限于离散动作空间,因为它们依赖于对单个状态-动作对估计 Q 值。在连续动作空间中,对整个动作空间进行 Q 值评估计算上不可行。为此,通常采用演员-评论家方法,其中评论家在离策略数据上进行训练以估计 Q 值,演员则训练以最大化评论家的输出。尽管这些方法广受欢迎,但常在训练期间出现不稳定。在本工作中,我们提出一种纯粹基于价值的连续控制框架,复审了 Q 函数的结构最大化,引入一组关键的架构和算法选择,以实现高效和稳定的学习。我们在多个标准仿真任务上评估了所提出的无演员 Q 学习方法,展示了与最先进基线相当的性能和样本效率,无需学习独立的演员。特别是在受约束动作空间的环境中,其中价值函数通常不光滑,我们的方法在结构最大化下超越了基于梯度最大化的传统演员-评论家方法。我们已在 https://github.com/USC-Lira/Q3C 上发布代码。
关键词
引用
@article{arxiv.2510.18828,
title = {Actor-Free Continuous Control via Structurally Maximizable Q-Functions},
author = {Yigit Korkmaz and Urvi Bhuwania and Ayush Jain and Erdem Bıyık},
journal= {arXiv preprint arXiv:2510.18828},
year = {2025}
}
备注
39th Conference on Neural Information Processing Systems (NeurIPS 2025)