中文

用于无监督强化学习的探索性扩散模型

机器学习 2025-05-19 v2 人工智能

摘要

无监督强化学习(Unsupervised Reinforcement Learning, URL)旨在通过在无奖励环境中探索多样化的状态或技能来预训练智能体,从而提高对下游任务的高效适应能力。由于在无监督探索期间无法获取外在奖励,现有方法会设计内在奖励来建模已探索的数据并鼓励进一步探索。然而,探索得到的数据始终是异构的,这要求内在奖励模型和预训练策略具备强大的表示能力。本文提出了探索性扩散模型(Exploratory Diffusion Model, ExDM),利用扩散模型的强表达能力拟合探索数据,同时提升探索效果并为下游任务提供高效初始化。具体而言,ExDM 能准确估计回放缓冲区中收集的数据分布,引入基于得分的内在奖励,以鼓励智能体探索更少访问的状态。获得预训练策略后,ExDM 可实现对下游任务的快速适应。我们提供了针对多步骤采样训练不稳定性和计算复杂度的理论分析和实用算法。广泛的实验表明,ExDM 在高效无监督探索和快速适应下游任务方面均优于现有 SOTA baseline,尤其在结构复杂的环境中表现突出。

关键词

引用

@article{arxiv.2502.07279,
  title  = {Exploratory Diffusion Model for Unsupervised Reinforcement Learning},
  author = {Chengyang Ying and Huayu Chen and Xinning Zhou and Zhongkai Hao and Hang Su and Jun Zhu},
  journal= {arXiv preprint arXiv:2502.07279},
  year   = {2025}
}