面向快速元强化学习适应的假设网络规划式探索
人工智能
2025-09-03 v2 机器学习
摘要
元强化学习(Meta-RL)在一系列相关任务中学习最优策略。Meta-RL 的一个核心挑战是快速识别先前学习的哪个任务与一个新任务最相似,以便快速适应它。尽管取得了显著成功,先前的方法通常依赖被动探索策略,例如随机动作时段,以相对于已学任务刻画新任务。当任务可清晰区分时这已足够,但当信息性转移稀少或仅由特定行为揭示时,被动探索限制了适应速度。我们提出假设规划式探索(HyPE),一种在适应期间主动规划动作序列以高效识别最相似的已学任务的方法。HyPE 在一个联合潜空间中运行,其中来自不同任务的状态-动作转移形成不同的路径。这种潜空间规划方法使 HyPE 能够作为大多数基于模型的 Meta-RL 算法的即插即用改进。通过使用规划式探索,当信息性转移稀疏时,HyPE 相比被动策略实现了指数级更低的失败概率。在一个自然语言 Alchemy 游戏中,HyPE 在 65-75% 的试验中识别出了最接近的任务,远优于 18-28% 的被动探索基线,并在相同样本预算下产生了多达 4 倍的更成功适应。
引用
@article{arxiv.2311.03701,
title = {Hypothesis Network Planned Exploration for Rapid Meta-Reinforcement Learning Adaptation},
author = {Maxwell Joseph Jacobson and Rohan Menon and John Zeng and Yexiang Xue},
journal= {arXiv preprint arXiv:2311.03701},
year = {2025}
}