中文

使用近端策略优化训练ANFIS策略

机器学习 2025-07-08 v2 人工智能

摘要

我们提出了一种基于近端策略优化(PPO)的强化学习方法,用于训练自适应神经模糊推理系统(ANFIS)。与先前使用深度Q网络(DQN)与ANFIS相结合的方法不同,我们的PPO框架利用稳定的基于策略的演员-评论家设置。我们在CartPole-v1环境中评估了该方法,并使用多个随机种子进行测试,PPO训练的模糊代理在20000次更新后始终以500的最大回报且方差为零,显著优于ANFIS-DQN基线在稳定性和收敛速度方面的表现。这突显了PPO在强化学习任务中训练可解释的神经模糊代理方面的潜力。

关键词

引用

@article{arxiv.2507.01039,
  title  = {On-Policy Optimization of ANFIS Policies Using Proximal Policy Optimization},
  author = {Kaaustaaub Shankar and Wilhelm Louw and Kelly Cohen},
  journal= {arXiv preprint arXiv:2507.01039},
  year   = {2025}
}

备注

Accepted to NAFIPS 2025