通过仅状态交互增强离线强化学习
机器学习
2024-10-04 v2
摘要
批量离线数据已被证明对强化学习非常有益。通过生成模型进行上采样可进一步放大其优势。本文考虑一种新的机会:与环境交互是可行的,但仅限于观测,即没有奖励反馈。这种设置具有广泛的适用性,因为模拟器甚至真实的网络物理系统通常是可访问的,而奖励往往难以获得或成本高昂。因此,学习者必须充分利用离线数据来合成有效的状态转移查询方案。我们的方法首先利用在线交互通过条件扩散模型生成高回报轨迹。然后通过拼接算法将其与原始离线轨迹混合,得到的增强数据可通用地应用于下游强化学习器。与扩展为利用仅状态交互的最先进数据增强方法相比,我们展示了优越的经验性能。
引用
@article{arxiv.2402.00807,
title = {Augmenting Offline Reinforcement Learning with State-only Interactions},
author = {Shangzhe Li and Xinhua Zhang},
journal= {arXiv preprint arXiv:2402.00807},
year = {2024}
}