超越自回归RTG:通过注入外部条件在决策转换器中的顺序建模之外进行条件化
机器学习
2026-05-08 v1 人工智能
摘要
决策转换器(DT)将离线强化学习表述为自回归序列建模,通过预测从Return-to-Go(RTG)、状态和动作标记的序列来实现良好结果。然而,RTG是一个总结未来奖励的标量,包含远少于典型状态或动作向量的信息,却消耗相同的计算预算。更糟的是,Transformer的自注意力成本随序列长度呈二次增长,因此将RTG作为单独标记包含在内会引入不必要的开销。我们提出了SlimDT,通过在顺序建模步骤之前将RTG信息注入到状态表示中,使Transformer仅处理紧凑的(状态、动作)序列。这减少了序列长度的三分之一,直接提高推理效率。在D4RL基准上,SlimDT在各种任务上均超越标准DT,实现了与现有SOTA方法相当的性能。将稀疏条件信号从信息丰富的序列中解耦因此获得了计算收益和更高的任务性能。
关键词
引用
@article{arxiv.2605.06104,
title = {Beyond Autoregressive RTG: Conditioning via Injection Outside Sequential Modeling in Decision Transformer},
author = {Yongyi Wang and Hanyu Liu and Lingfeng Li and Bozhou Chen and Ang Li and Qirui Zheng and Xionghui Yang and Chucai Wang and Wenxin Li},
journal= {arXiv preprint arXiv:2605.06104},
year = {2026}
}