中文

何时应优先选择决策Transformer进行离线强化学习?

机器学习 2024-03-13 v3 人工智能

摘要

离线强化学习(RL)允许智能体从静态数据集中学习有效的、最大化回报的策略。离线RL三种流行算法分别是保守Q学习(CQL)、行为克隆(BC)和决策Transformer(DT),分别属于Q学习、模仿学习和序列建模类别。一个关键开放问题是:在什么条件下优先选择哪种算法?我们通过探索这些算法在常用D4RL和Robomimic基准上的性能,对该问题进行了实证研究。我们设计针对性实验以理解它们关于数据次优性、任务复杂度和随机性的行为。我们的关键发现是:(1) DT比CQL需要更多数据来学习有竞争力的策略,但更鲁棒;(2) 在稀疏奖励和低质量数据设定下,DT是比CQL和BC都明显更好的选择;(3) 随着任务时域增加或数据来自人类演示者时,DT和BC更可取;(4) CQL在高随机性与低数据质量组合的情形中表现出色。我们还研究了DT在Atari和D4RL上的架构选择与扩展趋势,并给出设计/扩展建议。我们发现将DT的数据量扩展5倍可在Atari上带来平均分数2.5倍的提升。

关键词

引用

@article{arxiv.2305.14550,
  title  = {When should we prefer Decision Transformers for Offline Reinforcement Learning?},
  author = {Prajjwal Bhargava and Rohan Chitnis and Alborz Geramifard and Shagun Sodhani and Amy Zhang},
  journal= {arXiv preprint arXiv:2305.14550},
  year   = {2024}
}

备注

International Conference on Learning Representations (ICLR) 2024