中文

可靠策略迭代:跨架构与环境扰动的性能鲁棒性

人工智能 2025-12-16 v1 机器学习

摘要

在近期工作中,我们提出了可靠策略迭代(RPI),将策略迭代的价值估计单调性恢复到了函数逼近设置中。在此,我们评估了 RPI 在两个经典控制任务——CartPole 和倒立摆——上的经验性能在神经网络和环境参数变化下的鲁棒性。与 DQN、Double DQN、DDPG、TD3 和 PPO 相比,RPI 在训练早期即达到近最优性能,并在训练持续过程中保持该策略。由于深度强化学习方法常常受到样本效率低、训练不稳定和超参数敏感性高的困扰,我们的结果凸显了 RPI 作为更可靠替代方案的前景。

关键词

引用

@article{arxiv.2512.12088,
  title  = {Reliable Policy Iteration: Performance Robustness Across Architecture and Environment Perturbations},
  author = {S. R. Eshwar and Aniruddha Mukherjee and Kintan Saha and Krishna Agarwal and Gugan Thoppe and Aditya Gopalan and Gal Dalal},
  journal= {arXiv preprint arXiv:2512.12088},
  year   = {2025}
}