解耦探索与策略优化:面向困难探索的不确定性引导树搜索
机器学习
2026-05-14 v4
摘要
发现的过程需要主动探索——即收集新的、信息丰富的数据的行为。然而,高效的自主探索仍然是一个未解决的主要问题。主流范式通过使用强化学习(RL)训练具有内在动机的智能体来应对这一挑战,最大化外在和内在奖励的复合目标。我们认为这种方法引入了不必要的开销:虽然策略优化对于精确的任务执行是必要的,但仅为了扩展状态覆盖范围而使用这种机制可能是低效的。在本文中,我们提出了一种新方法,该方法明确地将探索与策略优化解耦,并在探索阶段完全绕过RL。我们的方法使用一种受“与赢家同行”算法启发的树搜索策略,并结合不确定性度量来系统地驱动探索。通过消除策略优化的开销,我们的方法在困难探索基准测试上的探索效率比标准的内在动机基线方法高一个数量级。此外,我们证明了探索过程中发现的轨迹可以使用现有的监督式反向学习算法提炼为可部署的策略,在Montezuma's Revenge、Pitfall!和Venture上,无需依赖领域特定知识,就以较大优势取得了最先进的性能。最后,我们通过在稀疏奖励设置下,直接从图像观测出发,无需专家演示或离线数据集,解决MuJoCo Adroit灵巧操作和AntMaze任务,展示了我们框架在高维连续动作空间中的通用性。据我们所知,对于Adroit任务,此前尚未实现过这一点。
引用
@article{arxiv.2603.22273,
title = {Decoupling Exploration and Policy Optimization: Uncertainty Guided Tree Search for Hard Exploration},
author = {Zakaria Mhammedi and James Cohan},
journal= {arXiv preprint arXiv:2603.22273},
year = {2026}
}