中文

epsilon 贪婪策略与优先经验回放下的 DQN 性能研究

机器学习 2025-11-06 v1 人工智能

摘要

我们对深度 Q 网络在有限环境中的表现进行详尽研究,强调 epsilon 贪婪探索计划和优先经验回放的影响。通过系统化实验,我们评估了 epsilon 衰减计划的变体如何影响学习效率、收敛行为和奖励优化。我们研究了优先经验回放如何导致更快的收敛和更高的回报,并展示了在多个仿真实验中比较均匀、无回放和优先策略的经验结果。我们的发现阐明了探索策略与记忆管理之间权衡和相互作用,为在资源受限的环境中进行稳健强化学习提供了实用建议。

关键词

引用

@article{arxiv.2511.03670,
  title  = {DQN Performance with Epsilon Greedy Policies and Prioritized Experience Replay},
  author = {Daniel Perkins and Oscar J. Escobar and Luke Green},
  journal= {arXiv preprint arXiv:2511.03670},
  year   = {2025}
}

备注

10 pages, 8 figures