VDSC:利用价值差异与状态计数增强探索时机
机器学习
2024-03-27 v1 人工智能
摘要
尽管深度强化学习中“探索多少”和“如何探索”的问题已受到相当关注,但对“何时探索”的研究仍相对较少。虽然更复杂的探索策略在特定(通常是稀疏奖励)环境中可能表现出色,但现有的更简单方法(如 ε-贪婪)在更广泛的领域范围内持续优于它们。这些更简单策略的吸引力在于其易于实现且跨领域通用。其缺点在于本质上是一种盲切换机制,完全忽略智能体的内部状态。本文提出利用智能体的内部状态来决定“何时探索”,以解决盲切换机制的不足。我们提出通过稳态实现的价值差异与状态计数(Value Discrepancy and State Counts,VDSC),一种用于高效探索时机的新方法。在 Atari 套件上的实验结果表明,我们的策略优于 ε-贪婪和 Boltzmann 等传统方法,以及 Noisy Nets 等更复杂的技术。
引用
@article{arxiv.2403.17542,
title = {VDSC: Enhancing Exploration Timing with Value Discrepancy and State Counts},
author = {Marius Captari and Remo Sasso and Matthia Sabatelli},
journal= {arXiv preprint arXiv:2403.17542},
year = {2024}
}