中文

高维动作空间的高效离策略学习

机器学习 2025-02-18 v3

摘要

现有的离策略强化学习算法通常依赖于显式的状态 - 动作值函数表示,由于维数灾难,这在高维动作空间中可能会出现问题。这种依赖性导致数据效率低下,因为在此类空间中维护状态 - 动作值函数具有挑战性。我们提出了一种高效方法,该方法仅利用状态值函数作为离策略深度强化学习的评论家(critic)。我们将这种方法称为 Vlearn,它通过消除对显式状态 - 动作值函数的需求,有效地规避了现有方法的局限性。为此,我们利用加权重要性采样损失,从离策略数据中学习深度值函数。虽然这对于线性方法很常见,但尚未与深度值函数网络相结合。这种向深度方法的转移并非直截了当,需要新颖的设计选择,如稳健的策略更新、用于避免优化偏差的双值函数网络以及重要性权重截断。我们还对我们估计量的方差与常用重要性采样估计量(如 V-trace)进行了新颖的分析。我们的方法提高了样本复杂度以及最终性能,并确保了在各种基准任务中一致且稳健的性能。在 Vlearn 中消除状态 - 动作值函数促进了简化的学习过程,从而产生了高回报的智能体。

关键词

引用

@article{arxiv.2403.04453,
  title  = {Efficient Off-Policy Learning for High-Dimensional Action Spaces},
  author = {Fabian Otto and Philipp Becker and Ngo Anh Vien and Gerhard Neumann},
  journal= {arXiv preprint arXiv:2403.04453},
  year   = {2025}
}

备注

Accepted at ICLR 2025