中文

规划Transformer:利用规划令牌实现长时域离线强化学习

机器学习 2024-09-17 v1 人工智能 计算与语言

摘要

离线强化学习的监督学习方法,特别是那些利用决策Transformer的方法,已在连续环境和稀疏奖励场景中展现出有效性。然而,由于自回归模型的高累积误差,它们通常难以处理长时域任务。为克服这一限制,我们超越了下一个令牌预测,引入了规划令牌(Planning Tokens),其中包含关于智能体未来的高层级、长时间尺度信息。在规则间隔内预测双时间尺度令牌,使我们的模型能够将这些长时域规划令牌用作一种隐式规划形式,以指导其低层级策略并减少累积误差。这种架构上的修改显著提升了长时域任务的性能,在复杂的D4RL环境中确立了新的最先进水平。此外,我们通过可解释的计划可视化和注意力图证明,规划令牌提高了模型策略的可解释性。

关键词

引用

@article{arxiv.2409.09513,
  title  = {Planning Transformer: Long-Horizon Offline Reinforcement Learning with Planning Tokens},
  author = {Joseph Clinton and Robert Lieck},
  journal= {arXiv preprint arXiv:2409.09513},
  year   = {2024}
}

备注

11 pages, 5 figures, Submitted to AAAI