离线强化学习中是否应优先选择决策转换器?
人工智能
2025-07-15 v1 机器学习
摘要
近年来,大量研究探索了Transformer架构应用于强化学习问题的应用。在此背景下,决策转换器(Decision Transformer, DT)因其能够将返回条件策略学习框架化为序列建模任务而受到广泛关注。最近,Bharghava等人(2024)对DT与更传统的基于MLP的离线RL算法(包括行为克隆(BC)和保守Q学习(CQL))进行了系统比较,声称DT在稀疏奖励和低质量数据环境中表现优越。本文通过在机器人操控任务(Robomimic)和运动学基准(D4RL)上的实验,表明基于MLP的过滤行为克隆(Filtered Behavior Cloning, FBC)在稀疏奖励环境中实现了与DT相当或更好的性能。FBC仅需从数据集中过滤低绩效轨迹,然后对过滤后的数据集执行常规行为克隆。FBC不仅非常简单明了,而且需要更少的训练数据且计算效率更高。结果表明,DT在稀疏奖励环境中并非首选方案。根据前期工作,DT在密集奖励环境中也非首选。因此,我们提出问题:DT是否曾经是首选?
引用
@article{arxiv.2507.10174,
title = {Should We Ever Prefer Decision Transformer for Offline Reinforcement Learning?},
author = {Yumi Omori and Zixuan Dong and Keith Ross},
journal= {arXiv preprint arXiv:2507.10174},
year = {2025}
}
备注
Accepted by RLBrew: Ingredients for Developing Generalist Agents workshop (RLC 2025)