中文

决策转换器与传统离线强化学习算法的比较

机器学习 2025-11-21 v1

摘要

离线强化学习(RL)旨在从预收集的数据集中导出有效策略,而无需主动与环境交互。虽然保守Q学习(CQL)和隐式Q学习(IQL)等传统离线RL算法已显示出前景,但在奖励密度不同的环境中,这些算法常面临在探索与开发之间取得平衡的挑战。最近提出的决策转换器(DT)方法将离线RL重新框定为序列建模问题,已在 various基准测试中展现出令人瞩目的成绩。本文对DT与传统离线RL算法在稠密和稀疏奖励设置下进行比较研究,评估其在ANT连续控制环境中的性能。我们的研究探讨了这些算法在不同奖励结构下的表现,考察其学习有效策略和跨不同反馈水平泛化的能力。通过对ANT环境中的经验分析,我们发现DT对奖励密度变化不够敏感,在稀疏奖励场景中尤其在中等专家数据集上表现突出。相比之下,传统基于价值的算法如IQL在稠密奖励设置和高质量数据上表现更佳,而CQL在不同数据质量下提供了均衡的性能。此外,DT表现出较低的性能方差,但计算资源需求显著高于传统方法。这些发现表明,序列建模方法可能更适用于奖励结构不确定或混合质量数据的情况,而基于价值的方法在稠密奖励和高质量演示的设置中仍具竞争力。

关键词

引用

@article{arxiv.2511.16475,
  title  = {A Comparison Between Decision Transformers and Traditional Offline Reinforcement Learning Algorithms},
  author = {Ali Murtaza Caunhye and Asad Jeewa},
  journal= {arXiv preprint arXiv:2511.16475},
  year   = {2025}
}

备注

15 pages, 4 figures, published in the Proceedings of the 46th Annual conference of the South African Institute of Computer Scientists and Information Technologists (SIACSIT 2025)