中文

面向离线强化学习的目标条件数据增强

机器学习 2025-09-03 v2 人工智能 机器人学

摘要

离线强化学习 (RL) 使能够从预收集的离线数据集中学习策略,放宽了直接与环境交互的需求。然而,受限于离线数据集的质量,通常无法在次优数据集中学习出优秀的策略。为解决数据集缺乏足够最优演示的问题,本文引入 Goal-cOnditioned Data Augmentation (GODA),一种基于目标条件的扩散方法,用于增强具有更高质量的样本。利用最近的生成模型进展,GODA 融入新颖的基于回报的目标条件及多种选择机制。具体而言,我们引入可控的缩放技术,以在数据采样期间提供更强的基于回报的引导。GODA 学习原始离线数据集的全面分布表示,同时生成具有选择性更高回报目标的新数据,从而最大化有限最优演示的效用。此外,我们提出了一种新颖的自适应门控条件方法,用于处理噪声输入和条件,从而增强目标导向引导的捕获。我们在 D4RL 基准和真实世界挑战中(具体为交通信号控制 (TSC) 任务)测试 GODA 在提高数据质量方面的有效性,并在各种离线 RL 算法中证明其优于最新数据增强方法的优势。

关键词

引用

@article{arxiv.2412.20519,
  title  = {Goal-Conditioned Data Augmentation for Offline Reinforcement Learning},
  author = {Xingshuai Huang and Di Wu and Benoit Boulet},
  journal= {arXiv preprint arXiv:2412.20519},
  year   = {2025}
}