DiffStitch:基于扩散的轨迹拼接增强离线强化学习
机器学习
2024-02-23 v2 人工智能
摘要
在离线强化学习(RL)中,所学策略的性能高度依赖于离线数据集的质量。然而,在许多情况下,离线数据集包含的最优轨迹非常有限,这给离线 RL 算法带来了挑战,因为智能体必须具备转移到高回报区域的能力。为了解决这个问题,我们引入了基于扩散的轨迹拼接,这是一种新颖的基于扩散的数据增强流水线,可系统地生成轨迹间的拼接转换。DiffStitch 有效地将低回报轨迹与高回报轨迹连接起来,形成全局最优轨迹,以解决离线 RL 算法面临的挑战。在 D4RL 数据集上进行的实证实验证明了 DiffStitch 在各种 RL 方法中的有效性。值得注意的是,DiffStitch 在一步法(IQL)、模仿学习方法(TD3+BC)和轨迹优化方法(DT)的性能上均展现出显著提升。
引用
@article{arxiv.2402.02439,
title = {DiffStitch: Boosting Offline Reinforcement Learning with Diffusion-based Trajectory Stitching},
author = {Guanghe Li and Yixiang Shan and Zhengbang Zhu and Ting Long and Weinan Zhang},
journal= {arXiv preprint arXiv:2402.02439},
year = {2024}
}