KEA:通过主动协调探索策略保持探索活性
机器学习
2025-06-10 v2
摘要
软演员-评论家(SAC)在连续控制任务中取得了显著的成功,但在稀疏奖励设置中却难掌握,由于奖励稀少,高效探索变得具有挑战性。虽然基于新奇性的探索方法通过鼓励探索新状态来解决此问题,但将其应用于 SAC 并非易事。特别是,管理基于新奇性的探索与 SAC 随机策略之间的相互作用,可能导致探索效率低下和冗余的样本收集。本文提出了 KEA(Keeping Exploration Alive),以解决将 SAC 与基于新奇性的探索相结合时平衡探索策略效率不足的问题。KEA 将新奇性增强的 SAC 与标准 SAC 智能体集成,通过切换机制进行主动协调。这种协调使智能体能够在高新奇性区域保持随机性,从而增强探索效率并减少重复的样本收集。我们首先在二维导航任务中分析了此潜在问题,然后在DeepSea硬性探索基准以及DeepMind控制套件中的稀疏奖励控制任务上评估了 KEA。与最新进的基于新奇性探索基线相比,我们的实验表明,KEA 在稀疏奖励设置下显著提高了学习效率和鲁棒性。
引用
@article{arxiv.2503.18234,
title = {KEA: Keeping Exploration Alive by Proactively Coordinating Exploration Strategies},
author = {Shih-Min Yang and Martin Magnusson and Johannes A. Stork and Todor Stoyanov},
journal= {arXiv preprint arXiv:2503.18234},
year = {2025}
}
备注
Accepted to ICML 2025