无策略梯度的复杂动作空间学习
机器学习
2025-09-03 v2 人工智能
机器学习
摘要
虽然传统观念认为策略梯度方法在复杂动作空间中优于动作价值方法,但基础研究表明在小型有限动作空间中两种范式是等价的(O'Donoghue 等,2017;Schulman 等,2017a)。这引出了一个问题:为何它们在动作空间复杂度提升时的计算可行性与性能却呈现分化。我们假设,此类情境下策略梯度的显著优势并非源于其本质特性,而是可以同样适用于动作价值方法的普遍原理,进而实现类似功能。我们识别出三项此类原理,并提供了将其纳入动作价值方法的框架。为支持我们的假设,我们在此框架中实现了我们称之为QMLE(Q-learning with maximum likelihood estimation,基于最大似然估计的Q学习)的方法。我们的结果表明,QMLE可用于复杂动作空间,其计算成本相当于策略梯度方法,完全无需使用策略梯度。此外,QMLE在DeepMind控制套件上表现出色,即使与最先进的方法如DMPO和D4PG进行比较也能显示出强劲性能。
关键词
引用
@article{arxiv.2410.06317,
title = {Learning in complex action spaces without policy gradients},
author = {Arash Tavakoli and Sina Ghiassian and Nemanja Rakićević},
journal= {arXiv preprint arXiv:2410.06317},
year = {2025}
}
备注
Published in TMLR (2025). Code: https://github.com/atavakol/qmle