中文

基于纯RL梯度的在线微调决策转换器

机器学习 2026-01-05 v1 人工智能

摘要

决策转换器(Decision Transformers, DTs)已成为一种强大的序列决策框架,通过将离线强化学习(RL)建模为序列建模问题来实现。然而, extending DTs 以纯RL梯度进行在线微调仍在很大程度上未被探索,因为现有方法在在线微调期间仍严重依赖监督序列建模目标。我们识别出遗憾回报重标(hindsight return relabeling)——在在线DTs中是标准组件——作为RL微调的关键障碍:虽然对监督学习有益,但它本质上与GRPO等重要抽样RL算法不兼容,导致训练不稳定。基于这一洞察,我们提出了新的算法,使决策转换器能够使用纯强化学习梯度进行在线微调。我们将GRPO适用于DTs,并引入若干关键修改,包括子轨迹优化以提高信用分配、序列级似然目标以提高稳定性和效率,以及主动抽样以鼓励在不确定区域的探索。通过大量实验,我们展示我们的方法在多个基准测试中超越现有在线DT基线并实现新的最佳性能,凸显了纯RL在线微调决策转换器的有效性。

关键词

引用

@article{arxiv.2601.00167,
  title  = {Online Finetuning Decision Transformers with Pure RL Gradients},
  author = {Junkai Luo and Yinglun Zhu},
  journal= {arXiv preprint arXiv:2601.00167},
  year   = {2026}
}