针对含跳跃数据的扩散模型下的鲁棒强化学习
机器学习
2025-09-19 v2 机器学习
摘要
强化学习(RL)已被证明在解决各领域的复杂决策任务中行之有效,但在连续时间环境中仍面临挑战,尤其是当状态动力学由带跳跃分量的随机微分方程(SDE)控制时。在本文中,我们通过引入均方双幂变差误差(MSBVE)算法来应对这一挑战,该算法在涉及显著随机噪声和跳跃的场景下提升了鲁棒性与收敛性。我们首先回顾了连续时间 RL 中常用的均方 TD 误差(MSTDE)算法,并指出其在处理状态动力学跳跃时的局限性。所提出的 MSBVE 算法最小化均方二次变差误差,在由带跳跃 SDE 表征的环境中,其性能优于 MSTDE。仿真与形式化证明表明,MSBVE 算法能在复杂环境中可靠地估计价值函数,在面对跳跃过程时超越了 MSTDE 的性能。这些发现凸显了替代误差度量对于提升连续时间框架下 RL 算法鲁棒性与有效性的重要性。
引用
@article{arxiv.2411.11697,
title = {Robust Reinforcement Learning under Diffusion Models for Data with Jumps},
author = {Chenyang Jiang and Donggyu Kim and Alejandra Quintos and Yazhen Wang},
journal= {arXiv preprint arXiv:2411.11697},
year = {2025}
}