改进的双 DQN:解决稳定性问题
人工智能
2024-10-30 v2
摘要
受 Double Q-learning 算法启发,Double-DQN(DDQN)算法最初提出是为了解决原始 DQN 算法中的过高估计问题。DDQN 已在理论和经验上成功展示了在计算目标值时动作评估与选择解耦的重要性;尽管所有收益仅通过对 DQN 算法的简单适配(如作者所言的最小可能改动)获得。然而,DDQN 的所提算法似乎出现了回退,因为策略网络参数再次出现在目标值函数中,而这些参数最初被 DQN 移除,以期解决学习中由移动目标引起的严重问题及其导致的不稳定性。因此,本文提出对 DDQN 算法的三种修改,以期在稳定性和过高估计两方面保持性能。这些修改聚焦于目标值函数中最佳动作选择与评估的解耦逻辑,以及解决移动目标问题的逻辑。与其他修改相比,每种修改各有优缺点。所述优缺点主要涉及相应算法所需的执行时间以及相应算法提供的稳定性。此外,在过高估计方面,若非优于原始 DDQN,这些修改似乎无一逊于原始 DDQN。为评估所提修改的有效性,进行了多项经验实验与理论实验。所得结果在本文中予以展示与讨论。
引用
@article{arxiv.2108.04115,
title = {Modified Double DQN: addressing stability},
author = {Shervin Halat and Mohammad Mehdi Ebadzadeh and Kiana Amani},
journal= {arXiv preprint arXiv:2108.04115},
year = {2024}
}