使用近端策略优化训练ANFIS策略
机器学习
2025-07-08 v2 人工智能
摘要
我们提出了一种基于近端策略优化(PPO)的强化学习方法,用于训练自适应神经模糊推理系统(ANFIS)。与先前使用深度Q网络(DQN)与ANFIS相结合的方法不同,我们的PPO框架利用稳定的基于策略的演员-评论家设置。我们在CartPole-v1环境中评估了该方法,并使用多个随机种子进行测试,PPO训练的模糊代理在20000次更新后始终以500的最大回报且方差为零,显著优于ANFIS-DQN基线在稳定性和收敛速度方面的表现。这突显了PPO在强化学习任务中训练可解释的神经模糊代理方面的潜力。
引用
@article{arxiv.2507.01039,
title = {On-Policy Optimization of ANFIS Policies Using Proximal Policy Optimization},
author = {Kaaustaaub Shankar and Wilhelm Louw and Kelly Cohen},
journal= {arXiv preprint arXiv:2507.01039},
year = {2025}
}
备注
Accepted to NAFIPS 2025