大规模显式策略条件价值函数
机器学习
2025-02-18 v1 人工智能
摘要
我们提出了一种显式策略条件价值函数(EPVF)的规模化策略,显著提高了在具有挑战性的连续控制任务上的性能。EPVF学习一个显式条件于策略参数的价值函数 V({\theta}),从而 enables 对任何策略的参数进行直接梯度式更新。然而,规模化的 EPVF 在参数增长受限和策略参数空间高效探索方面存在挑战。为此,我们利用 GPU 仿真器实现大规模并行化、大批量处理、权重裁剪和缩放扰动。我们的结果表明,EPVF 可以规模化以解决复杂任务,如自定义 Ant 环境,并且能够与基于深度强化学习(DRL)的先进基线(如近端策略优化(PPO)和软演化者-评论家(SAC))竞争。我们进一步探索了来自前期工作的基于动作的策略参数表示以及专用神经网络架构,这些在 DRL 语境中尚未被使用。
关键词
引用
@article{arxiv.2502.11949,
title = {Massively Scaling Explicit Policy-conditioned Value Functions},
author = {Nico Bohlinger and Jan Peters},
journal= {arXiv preprint arXiv:2502.11949},
year = {2025}
}