基于好奇探索的目标条件离线规划
机器学习
2023-11-29 v1 人工智能
摘要
好奇心已在深度强化学习中确立为强大的探索策略。值得注意的是,利用预期未来新颖性作为内在动机已被证明能高效生成探索性轨迹以及鲁棒的动力学模型。我们考虑从此类无监督探索技术的产物中提取目标条件行为、且无需额外环境交互的挑战。我们发现,用于提取值函数与策略的常规目标条件强化学习方法在这一困难的离线设定中表现不佳。通过分析最优目标条件值函数的几何结构,我们将此问题归因于所学值中一类特定的估计伪影。为缓解其出现,我们提出将基于模型的在学价值地形上的规划与基于图的值聚合方案相结合。我们展示了该组合如何纠正局部与全局伪影,从而在多样模拟环境中取得零样本目标到达性能的显著提升。
引用
@article{arxiv.2311.16996,
title = {Goal-conditioned Offline Planning from Curious Exploration},
author = {Marco Bagatella and Georg Martius},
journal= {arXiv preprint arXiv:2311.16996},
year = {2023}
}