基于引导的生成轨迹增强:用于离线强化学习
人工智能
2024-11-08 v5 机器学习
摘要
离线强化学习 (Offline RL) 通过无需任何在线交互从静态数据集中学习有效决策策略,这带来了诸多挑战。数据增强技术,如噪声注入和数据合成,旨在通过平滑所学习的状态-动作区域来提高 Q 函数逼近的质量。然而,这些方法往往未能直接提高离线数据集的质量,导致次优结果。为此,我们引入GTA (Generative Trajectory Augmentation),一种新型生成式数据增强方法,旨在通过增强轨迹来丰富离线数据,使其既具有高回报又符合动态可行性。GTA 在数据增强框架中应用扩散模型。GTA 对原始轨迹进行部分噪声处理,然后通过对放大回报值进行条件化来进行去噪。我们的结果表明,GTA作为一种通用的数据增强策略,可提升各种具有独特挑战的任务中常用离线 RL 算法的性能。此外,我们对GTA增强的数据进行质量分析,表明GTA提高了数据的质量。我们的代码可在 https://github.com/Jaewoopudding/GTA 获取。
引用
@article{arxiv.2405.16907,
title = {GTA: Generative Trajectory Augmentation with Guidance for Offline Reinforcement Learning},
author = {Jaewoo Lee and Sujin Yun and Taeyoung Yun and Jinkyoo Park},
journal= {arXiv preprint arXiv:2405.16907},
year = {2024}
}
备注
NeurIPS 2024. Previously accepted (Spotlight) to ICLR 2024 Workshop on Generative Models for Decision Making. Jaewoo Lee and Sujin Yun are equal contribution authors