中文

Lipschitz正则化评论员导致策略对转移动力学不确定性的鲁棒性

机器学习 2026-01-29 v4

摘要

转移动力学中的不确定性在强化学习(RL)中构成了关键挑战,通常导致训练好的策略在硬件部署时性能下降。许多鲁棒强化学习方法遵循两种策略:通过Lipschitz正则化强制actor或actor-critic模块的平滑性,或学习鲁棒的Bellman算子。然而,第一种策略没有研究仅对critic进行Lipschitz正则化对策略鲁棒性的影响,而第二种策略缺乏在真实场景中的全面验证。基于这一空白和先前工作,我们提出PPO-PGDLC,一种基于近端策略优化(PPO)的算法,它结合了投影梯度下降(PGD)和Lipschitz正则化评论员(LC)。PGD组件在不确定性集内计算对抗状态以近似鲁棒Bellman算子,而Lipschitz正则化评论员进一步提高了学习策略的平滑性。在两个经典控制任务和一个真实机器人运动任务上的实验结果表明,与几种基线算法相比,PPO-PGDLC在环境扰动下实现了更好的性能并预测了更平滑的动作。

关键词

引用

@article{arxiv.2404.13879,
  title  = {Lipschitz-Regularized Critics Lead to Policy Robustness Against Transition Dynamics Uncertainty},
  author = {Xulin Chen and Ruipeng Liu and Zhenyu Gan and Garrett E. Katz},
  journal= {arXiv preprint arXiv:2404.13879},
  year   = {2026}
}

备注

8 pages, 4 figures