中文

Reinformer:面向离线强化学习的最大回报序列建模

机器学习 2024-06-04 v3

摘要

作为一种数据驱动的范式,离线强化学习 (RL) 已被表述为以包含回报、目标或未来轨迹的后见之明信息为条件的序列建模。尽管前景广阔,但这种监督范式忽略了 RL 最大化回报的核心目标。这种忽略直接导致了缺乏轨迹拼接能力,从而影响序列模型从次优数据中学习。在这项工作中,我们引入了最大回报序列建模的概念,将最大化回报的目标整合到现有的序列模型中。我们提出了强化 Transformer (Reinformer),表明序列模型被 RL 目标所强化。Reinformer 在训练阶段额外纳入了最大化回报的目标,旨在预测分布内的最大未来回报。在推理过程中,这种分布内最大回报将指导最优动作的选择。从经验上看,Reinformer 在 D4RL 基准测试中与经典 RL 方法具有竞争力,并且在轨迹拼接能力方面优于 SOTA 序列模型。代码公开于 https://github.com/Dragon-Zhuang/Reinformer。

关键词

引用

@article{arxiv.2405.08740,
  title  = {Reinformer: Max-Return Sequence Modeling for Offline RL},
  author = {Zifeng Zhuang and Dengyun Peng and Jinxin Liu and Ziqi Zhang and Donglin Wang},
  journal= {arXiv preprint arXiv:2405.08740},
  year   = {2024}
}

备注

ICML 2024