中文

QF-tuner:打破强化学习传统

机器学习 2025-03-19 v4 人工智能 神经与进化计算

摘要

在强化学习算法中,超参数调优方法指的是选择可能提高整体性能的最优参数。手动或随机的超参数调优方法可能导致强化学习算法产生不同结果。在本文中,我们提出了一种名为QF-tuner的新方法,用于Q学习算法中的自动超参数调优,该方法使用FOX优化算法(FOX)。此外,在FOX中采用了一个新的目标函数,该函数优先考虑奖励而非学习误差和时间。QF-tuner首先运行FOX,并尝试通过执行Q学习算法来最小化每次迭代中从观测值得到的适应度值。所提方法使用OpenAI Gym中的两个控制任务(CartPole和FrozenLake)进行了评估。实验结果表明,QF-tuner优于其他优化算法,如粒子群优化(PSO)、蜜蜂算法(BA)、遗传算法(GA)和随机方法。在FrozenLake任务上,QF-tuner将奖励提高了36%,学习时间减少了26%;而在CartPole任务上,奖励提高了57%,学习时间减少了20%。因此,QF-tuner是Q学习算法中超参数调优的重要方法,能够为控制任务问题提供更有效的解决方案。

关键词

引用

@article{arxiv.2402.16562,
  title  = {QF-tuner: Breaking Tradition in Reinforcement Learning},
  author = {Mahmood A. Jumaah and Yossra H. Ali and Tarik A. Rashid},
  journal= {arXiv preprint arXiv:2402.16562},
  year   = {2025}
}

备注

11 pages