中文

用于离线强化学习的评论家引导决策 Transformer

机器学习 2023-12-22 v1 人工智能

摘要

离线强化学习(RL)的最新进展凸显了返回条件监督学习(RCSL)的能力,这是一种以监督方式基于每个状态的目标返回学习动作分布的范式。然而,现有的 RCSL 方法主要关注确定性轨迹建模,忽视了随机状态转移和未来轨迹分布的多样性。一个根本性的挑战源于单个轨迹内的采样返回与多个轨迹间的期望返回之间的不一致性。幸运的是,基于价值的方法通过利用价值函数来近似期望返回,从而有效地解决了这种不一致性。基于这些见解,我们提出了一种名为评论家引导决策 Transformer(Critic-Guided Decision Transformer, CGDT)的新方法,该方法结合了基于价值方法对长期返回的可预测性与决策 Transformer 的轨迹建模能力。通过引入一个学习到的价值函数(即评论家),CGDT 确保了指定的目标返回与动作的期望返回之间的直接对齐。这种整合弥合了 RCSL 的确定性与基于价值方法的概率特性之间的差距。在随机环境和 D4RL 基准数据集上的实证评估表明,CGDT 优于传统的 RCSL 方法。这些结果突显了 CGDT 推动离线 RL 最新技术发展的潜力,并将 RCSL 的适用性扩展到了广泛的 RL 任务中。

关键词

引用

@article{arxiv.2312.13716,
  title  = {Critic-Guided Decision Transformer for Offline Reinforcement Learning},
  author = {Yuanfu Wang and Chao Yang and Ying Wen and Yu Liu and Yu Qiao},
  journal= {arXiv preprint arXiv:2312.13716},
  year   = {2023}
}

备注

Accepted at AAAI 2024