中文

先探索后利用:通过元学习解决困难的探索-利用权衡问题

机器学习 2024-11-06 v2 人工智能

摘要

标准强化学习(RL)智能体从未像人类那样进行智能探索(即考虑复杂的领域先验并基于先前的探索快速适应)。在多个回合中,RL智能体甚至难以执行简单的探索策略,例如避免重复探索同一位置的系统性搜索。这种糟糕的探索限制了其在具有挑战性领域中的性能。元强化学习(meta-RL)是一种潜在的解决方案,因为与标准RL不同,元RL能够学习探索,并有可能学习到远超标准RL的高度复杂策略,例如在前期的回合中进行实验以学习新技能,或开展实验以了解当前环境。传统的元RL关注于学习最优地平衡探索与利用以最大化回合序列的累积奖励的问题(例如,旨在最大化锦标赛中的总胜场数——同时作为玩家不断提升)。我们发现了一种最先进的累积奖励元RL方法所面临的新挑战。当最优行为需要进行牺牲即时奖励以换取更高后续奖励的探索时,现有的最先进累积奖励元RL方法会陷入未能探索的局部最优。我们的方法First-Explore通过学习的两种策略克服了这一局限:一种仅用于探索,一种仅用于利用。当探索需要放弃前期回合的奖励时,First-Explore显著优于现有的累积元RL方法。通过识别并解决先前未被认识的放弃前期回合奖励的问题,First-Explore代表着向开发能够在更广泛领域中进行类人探索的元RL算法迈出了重要一步。

关键词

引用

@article{arxiv.2307.02276,
  title  = {First-Explore, then Exploit: Meta-Learning to Solve Hard Exploration-Exploitation Trade-Offs},
  author = {Ben Norman and Jeff Clune},
  journal= {arXiv preprint arXiv:2307.02276},
  year   = {2024}
}

备注

Accepted to NeurIPS 2024. Revised version with updated experimental results