随机环境下的分布价值梯度
机器学习
2026-03-04 v3
摘要
梯度正则化的价值学习方法通过利用学习到的转移动力学和奖励模型来估计回报梯度,从而提高了样本效率。然而,现有方法(如MAGE)在随机或噪声环境中表现不佳,限制了其适用性。在这项工作中,我们通过将连续状态-动作空间上的分布强化学习扩展到不仅对标量状态-动作价值函数的分布进行建模,而且对其梯度也进行建模,来解决这些局限性。我们将这种方法称为分布索博列夫训练。受随机价值梯度(SVG)的启发,我们的方法使用一个通过条件变分自编码器(cVAE)实现的单步世界模型来建模奖励和转移分布。所提出的框架是基于样本的,并使用最大切片最大均值差异(MSMMD)来实例化分布贝尔曼算子。我们证明了索博列夫增强的贝尔曼算子是一个具有唯一不动点的压缩映射,并强调了梯度感知强化学习中压缩映射背后的一个基本平滑度权衡。为了验证我们的方法,我们首先在一个简单的随机强化学习玩具问题上展示了其有效性,然后在多个MuJoCo环境上对其性能进行了基准测试。
引用
@article{arxiv.2601.20071,
title = {Distributional value gradients for stochastic environments},
author = {Baptiste Debes and Tinne Tuytelaars},
journal= {arXiv preprint arXiv:2601.20071},
year = {2026}
}