基于时间距离的离线模型基强化学习的转换增强
机器学习
2025-05-20 v1 人工智能
机器人学
摘要
离线强化学习(RL)的目标是从固定数据集中提取高性能策略,最小化因超分布(OOD)样本导致的性能下降。离线模型基强化学习(MBRL)是一种通过通过学习的动态模型生成的增强转换来丰富状态-动作转换,从而缓解 OOD 问题的有前景的方法。然而,经典的离线 MBRL 方法在稀疏奖励和长期程度任务中常常困难。本文引入一种新型 MBRL 框架,称为时间距离感知转换增强(TempDATA),其在而非原始状态空间中生成时序结构化潜在空间的增强转换。为建模长期程度行为,TempDATA 在轨迹和转换水平上学习潜在抽象,以捕捉时间距离。我们的实验表明,TempDATA 在 D4RL AntMaze、FrankaKitchen、CALVIN 和基于像素的 FrankaKitchen 上超越了以往的离线 MBRL 方法,并在性能上与扩散轨迹增强和目标条件 RL 相匹配或优于。
引用
@article{arxiv.2505.13144,
title = {Temporal Distance-aware Transition Augmentation for Offline Model-based Reinforcement Learning},
author = {Dongsu Lee and Minhae Kwon},
journal= {arXiv preprint arXiv:2505.13144},
year = {2025}
}
备注
2025 ICML