中文

基于分类器自由扩散生成的离线到在线强化学习

机器学习 2025-08-12 v1 人工智能

摘要

离线到在线强化学习 (O2O RL) 旨在对预训练策略进行在线微调,以减少昂贵的在线交互。现有工作利用离线数据生成符合在线数据分布的数据用于数据增强。然而,生成的数据仍与在线数据存在差距,限制了整体性能。为此,我们提出了一种新型数据增强方法:Classifier-Free Diffusion Generation (CFDG)。无需引入额外的分类器训练开销,CFDG 利用分类器自由扩散技术显著提升离线数据与在线数据异构分布下的生成质量。此外,它采用一种重新加权方法,使更多生成数据与在线数据对齐,从而在保持代理稳定性的同时提升性能。实验结果表明,CFDG 在重放两种数据类型或使用标准扩散模型生成新数据时均表现更佳。该方法具有良好的通用性,可集成到现有的离线到在线 RL 算法中。通过将 CFDG 实现于 IQL、PEX 和 APL 等流行方法,我们在 D4RL 基准(包括 MuJoCo 和 AntMaze)上实现了约 15% 的平均性能提升。

关键词

引用

@article{arxiv.2508.06806,
  title  = {Offline-to-Online Reinforcement Learning with Classifier-Free Diffusion Generation},
  author = {Xiao Huang and Xu Liu and Enze Zhang and Tong Yu and Shuai Li},
  journal= {arXiv preprint arXiv:2508.06806},
  year   = {2025}
}

备注

ICML2025