Adventurer: 基于双向生成对抗网络(BiGAN)的深度强化学习探索
机器学习
2025-03-25 v1 人工智能
摘要
深度强化学习的最新进展在学习复杂且以往难以处理的问题方面取得了巨大成功。然而,样本效率和局部最优性仍然是重大挑战。为了应对这些挑战,基于新颖性的探索策略应运而生并展现出可观的潜力。遗憾的是,没有单一算法能在所有任务中均优于其他算法,且大多数算法在处理具有高维和复杂观测的任务时面临困难。在本研究中,我们提出了一种基于双向生成对抗网络(BiGAN)的新颖性驱动探索算法 Adventurer,其中 BiGAN 被训练用于估计状态新颖性。直观上,在已访问状态分布上训练的生成器应该只能生成来自已访问状态分布的状态。因此,利用生成器从特定潜在表示重构输入状态时,新颖状态将导致更大的重构误差。我们表明,BiGAN 在估计复杂观测的状态新颖性方面表现良好。这种新颖性估计方法可以与基于内在奖励的探索相结合。我们的实证结果表明,Adventurer 在一系列流行的基准任务上取得了具有竞争力的结果,包括连续机器人操作任务(例如 Mujoco robotics)和高维基于图像的任务(例如 Atari games)。
引用
@article{arxiv.2503.18612,
title = {Adventurer: Exploration with BiGAN for Deep Reinforcement Learning},
author = {Yongshuai Liu and Xin Liu},
journal= {arXiv preprint arXiv:2503.18612},
year = {2025}
}
备注
Accepted at Applied Intelligence