基于模型的被动探索增强强化学习
人工智能
2025-10-30 v1
摘要
探索是强化学习 (RL) 的基本问题,因为它决定了智能体如何有效地发现和利用其环境结构以实现最佳性能。现有的探索方法大致可分为两类:主动探索和被动探索。前者将策略中的随机性引入,但在高维环境中难以实现,而后者则通过适应性地优先处理回放缓冲区中的转换来增强探索,却受限于样本的多样性。为解决被动探索的局限性,我们提出了模型生成探索 (MoGE),通过生成关键状态并基于转换模型合成符合动态一致性的经验来增强探索。MoGE 包含两个组件:(1) 基于评估每个状态对策略探索潜在影响的实用函数指导下合成关键状态的扩散生成器;(2) 用于基于关键状态构建关键转换的单步想象世界模型。我们的方法采用模块化表述,符合离屏学习原则,允许无需更改其核心结构即可 seamless 集成到现有算法中以提高探索。在 OpenAI Gym 和 DeepMind Control Suite 上的实验结果表明,MoGE 有效地桥接了探索与策略学习,显著提高了复杂控制任务中的样本效率和性能。
引用
@article{arxiv.2510.25529,
title = {Off-policy Reinforcement Learning with Model-based Exploration Augmentation},
author = {Likun Wang and Xiangteng Zhang and Yinuo Wang and Guojian Zhan and Wenxuan Wang and Haoyu Gao and Jingliang Duan and Shengbo Eben Li},
journal= {arXiv preprint arXiv:2510.25529},
year = {2025}
}