QF-tuner:打破强化学习传统
机器学习
2025-03-19 v4 人工智能
神经与进化计算
摘要
在强化学习算法中,超参数调优方法指的是选择可能提高整体性能的最优参数。手动或随机的超参数调优方法可能导致强化学习算法产生不同结果。在本文中,我们提出了一种名为QF-tuner的新方法,用于Q学习算法中的自动超参数调优,该方法使用FOX优化算法(FOX)。此外,在FOX中采用了一个新的目标函数,该函数优先考虑奖励而非学习误差和时间。QF-tuner首先运行FOX,并尝试通过执行Q学习算法来最小化每次迭代中从观测值得到的适应度值。所提方法使用OpenAI Gym中的两个控制任务(CartPole和FrozenLake)进行了评估。实验结果表明,QF-tuner优于其他优化算法,如粒子群优化(PSO)、蜜蜂算法(BA)、遗传算法(GA)和随机方法。在FrozenLake任务上,QF-tuner将奖励提高了36%,学习时间减少了26%;而在CartPole任务上,奖励提高了57%,学习时间减少了20%。因此,QF-tuner是Q学习算法中超参数调优的重要方法,能够为控制任务问题提供更有效的解决方案。
引用
@article{arxiv.2402.16562,
title = {QF-tuner: Breaking Tradition in Reinforcement Learning},
author = {Mahmood A. Jumaah and Yossra H. Ali and Tarik A. Rashid},
journal= {arXiv preprint arXiv:2402.16562},
year = {2025}
}
备注
11 pages