中文

$\beta$-DQN:通过演化行为改进深度 Q 学习

机器学习 2025-10-29 v2 人工智能

摘要

尽管已提出许多复杂的探索方法,但其缺乏通用性且计算成本高,常使研究人员倾向于选择如 ϵ\epsilon-greedy 的简单方法。受此启发,我们引入了 β\beta-DQN,一种简单高效的探索方法,通过行为函数 β\beta 增强标准 DQN。该函数估计在每个状态下采取每个动作的概率。通过利用 β\beta,我们生成了一组多样化的策略群体,在状态-动作覆盖率和过估计偏差校正之间平衡探索。我们设计了一个自适应元控制器来为每个回合选择有效策略,实现了灵活且可解释的探索。β\beta-DQN 易于实现,且仅给标准 DQN 增加极小的计算开销。在简单和具有挑战性的探索领域上的实验表明,β\beta-DQN 在广泛任务中优于现有基线方法,为改进深度强化学习中的探索提供了有效解决方案。

关键词

引用

@article{arxiv.2501.00913,
  title  = {$\beta$-DQN: Improving Deep Q-Learning By Evolving the Behavior},
  author = {Hongming Zhang and Fengshuo Bai and Chenjun Xiao and Chao Gao and Bo Xu and Martin Müller},
  journal= {arXiv preprint arXiv:2501.00913},
  year   = {2025}
}

备注

aamas 2025