利用条件扩散模型拼接子轨迹用于目标条件离线强化学习
人工智能
2024-02-13 v1
摘要
离线目标条件强化学习(Offline GCRL)是强化学习中一个重要问题,其专注于仅从预先收集的行为数据集中获取多样化的目标导向技能。在此设定下,除了达成目标时,通常缺乏奖励反馈,这使得仅从有限的次优行为数据集中学习策略变得困难。此外,现实场景涉及长时域规划,这需要从子轨迹中提取有用的技能。最近,条件扩散模型已被证明是为强化学习生成高质量长时域规划的一种有前景的方法。然而,由于该方法所做出的一些技术假设,其在目标条件设定下的实用性仍然有限。在本文中,我们提出了 SSD(基于扩散的子轨迹拼接),一种基于模型的离线 GCRL 方法,利用条件扩散模型来解决这些局限性。概括而言,我们使用扩散模型生成以目标目标和价值为条件的未来规划,其中目标价值由目标重标记的离线数据集估计得出。我们在 GCRL 任务的标准基准集上报告了最先进的性能,并展示了成功拼接离线数据中的次优轨迹片段以生成高质量规划的能力。
引用
@article{arxiv.2402.07226,
title = {Stitching Sub-Trajectories with Conditional Diffusion Model for Goal-Conditioned Offline RL},
author = {Sungyoon Kim and Yunseon Choi and Daiki E. Matsunaga and Kee-Eung Kim},
journal= {arXiv preprint arXiv:2402.07226},
year = {2024}
}