$\beta$-DQN:通过演化行为改进深度 Q 学习
机器学习
2025-10-29 v2 人工智能
摘要
尽管已提出许多复杂的探索方法,但其缺乏通用性且计算成本高,常使研究人员倾向于选择如 -greedy 的简单方法。受此启发,我们引入了 -DQN,一种简单高效的探索方法,通过行为函数 增强标准 DQN。该函数估计在每个状态下采取每个动作的概率。通过利用 ,我们生成了一组多样化的策略群体,在状态-动作覆盖率和过估计偏差校正之间平衡探索。我们设计了一个自适应元控制器来为每个回合选择有效策略,实现了灵活且可解释的探索。-DQN 易于实现,且仅给标准 DQN 增加极小的计算开销。在简单和具有挑战性的探索领域上的实验表明,-DQN 在广泛任务中优于现有基线方法,为改进深度强化学习中的探索提供了有效解决方案。
引用
@article{arxiv.2501.00913,
title = {$\beta$-DQN: Improving Deep Q-Learning By Evolving the Behavior},
author = {Hongming Zhang and Fengshuo Bai and Chenjun Xiao and Chao Gao and Bo Xu and Martin Müller},
journal= {arXiv preprint arXiv:2501.00913},
year = {2025}
}
备注
aamas 2025