面向离线强化学习的无监督数据生成:从模型的视角
机器学习
2025-06-25 v1
摘要
离线强化学习 (RL) 近年来受到 RL 研究者的广泛关注。然而,离线 RL 的性能受到分布外问题的制约,这一问题可通过在线 RL 中的反馈进行纠正。以往的离线 RL 研究侧重于限制离线算法在分布内的甚至样本内动作采样。相比之下,较少关注批次数据的影响。本文首先从模型基的离线 RL 优化视角构建了批次数据与离线 RL 算法性能之间的桥梁。我们得出结论:在轻度假设下,行为策略生成的状态-动作对分布与最优策略生成的分布之间的距离,决定了基于模型的离线 RL 学习的策略与最优策略之间的性能差距。其次,我们揭示在任务无关设置下,一系列由无监督 RL 训练的策略可最小化性能差距中的最坏情况后悔。鼓舞着我们基于理论结论,提出 UDG (无监督数据生成) 以在任务无关设置下生成数据并选择合适的数据用于离线训练。实验结果表明,UDG 在解决未知任务方面优于监督数据生成方法。
引用
@article{arxiv.2506.19643,
title = {Unsupervised Data Generation for Offline Reinforcement Learning: A Perspective from Model},
author = {Shuncheng He and Hongchang Zhang and Jianzhun Shao and Yuhang Jiang and Xiangyang Ji},
journal= {arXiv preprint arXiv:2506.19643},
year = {2025}
}