Reinformer:面向离线强化学习的最大回报序列建模
机器学习
2024-06-04 v3
摘要
作为一种数据驱动的范式,离线强化学习 (RL) 已被表述为以包含回报、目标或未来轨迹的后见之明信息为条件的序列建模。尽管前景广阔,但这种监督范式忽略了 RL 最大化回报的核心目标。这种忽略直接导致了缺乏轨迹拼接能力,从而影响序列模型从次优数据中学习。在这项工作中,我们引入了最大回报序列建模的概念,将最大化回报的目标整合到现有的序列模型中。我们提出了强化 Transformer (Reinformer),表明序列模型被 RL 目标所强化。Reinformer 在训练阶段额外纳入了最大化回报的目标,旨在预测分布内的最大未来回报。在推理过程中,这种分布内最大回报将指导最优动作的选择。从经验上看,Reinformer 在 D4RL 基准测试中与经典 RL 方法具有竞争力,并且在轨迹拼接能力方面优于 SOTA 序列模型。代码公开于 https://github.com/Dragon-Zhuang/Reinformer。
关键词
引用
@article{arxiv.2405.08740,
title = {Reinformer: Max-Return Sequence Modeling for Offline RL},
author = {Zifeng Zhuang and Dengyun Peng and Jinxin Liu and Ziqi Zhang and Donglin Wang},
journal= {arXiv preprint arXiv:2405.08740},
year = {2024}
}
备注
ICML 2024