强化学习中的时间相关隐空间探索
机器学习
2024-12-09 v1 人工智能
摘要
高效探索仍然是深度强化学习中长期存在的问题。现有方法不完全依赖环境的外在奖励,而是使用内在奖励来增强探索。然而,我们证明这些方法容易受到Noisy TV和随机性的影响。为了解决这一问题,我们提出了时间相关隐空间探索(TeCLE),这是一种新颖的内在奖励公式,采用动作条件隐空间和时间相关性。动作条件隐空间估计状态的概率分布,从而避免为不可预测的状态分配过多的内在奖励,有效解决了上述两个问题。虽然先前的工作在动作选择中注入时间相关性,但所提方法将其注入内在奖励计算中。我们发现,注入的时间相关性决定了智能体的探索行为。各种实验表明,智能体表现良好的环境取决于时间相关性的程度。据我们所知,所提出的TeCLE是首个考虑动作条件隐空间和时间相关性以驱动好奇心探索的方法。我们证明了所提的TeCLE在基准环境中(包括Minigrid和Stochastic Atari)对Noisy TV和随机性具有鲁棒性。
引用
@article{arxiv.2412.04775,
title = {A Temporally Correlated Latent Exploration for Reinforcement Learning},
author = {SuMin Oh and WanSoo Kim and HyunJin Kim},
journal= {arXiv preprint arXiv:2412.04775},
year = {2024}
}