中文

面向离线强化学习的离线轨迹优化

机器学习 2025-07-11 v2 人工智能

摘要

离线强化学习(RL)旨在无需在线探索地学习策略。为扩大训练数据,基于模型的离线强化学习通过学习环境动态模型,将其作为虚拟环境生成仿真数据以增强策略学习。然而,现有离线强化学习的数据增强方法存在(i)短视程度仿真的有限提升;(ii)缺乏对生成数据的评估与纠正,导致增强数据质量低下。本文提出一种离线轨迹优化方法(OTTO),其核心思路是进行长程仿真,并利用模型不确定性对增强数据进行评估与纠正。具体而言,我们提出了一套 Transformer 集成模型,即世界转换器(World Transformers),用于预测环境状态动力学与奖励函数。提出三种策略通过扰动离线数据中的动作,利用世界转换器生成长程轨迹仿真。随后,引入基于不确定性的世界评估器(World Evaluator),首先评估生成轨迹的置信度,然后对低置信度数据进行纠正。最终,我们联合原始数据与纠正后的增强数据训练离线强化学习算法。OTTO 作为可插拔模块,可集成到现有的基于模型无关的离线强化学习方法中。实验在 various benchmark 上表明,OTTO 能有效提升代表性离线强化学习算法的性能,包括稀疏奖励环境如 AntMaze。代码已公开于 https://github.com/ZiqiZhao1/OTTO。

关键词

引用

@article{arxiv.2404.10393,
  title  = {Offline Trajectory Optimization for Offline Reinforcement Learning},
  author = {Ziqi Zhao and Zhaochun Ren and Liu Yang and Yunsen Liang and Fajie Yuan and Pengjie Ren and Zhumin Chen and jun Ma and Xin Xin},
  journal= {arXiv preprint arXiv:2404.10393},
  year   = {2025}
}

备注

Accepted at SIGKDD 2025