面向决策转换器的预测编码
机器学习
2025-04-04 v2
摘要
近期工作在离线强化学习(RL)中表明,将决策建模形式化为返回条件监督学习具有显著效果。尤其值得注意的是,决策转换器(DT)架构在多个领域展现出潜力。然而,尽管DT最初取得了成功,但在几个具有挑战性的数据集上表现不佳。这一局限性源于在引导策略学习中使用返回条件不够高效,尤其是在非结构化和次优数据集上,导致DT未能有效学习时序组成性。此外,这一问题在长期稀疏奖励任务中可能进一步恶化。为此,我们提出面向决策转换器的预测编码框架(PCDT),该框架利用广义未来条件来增强DT方法。PCDT采用扩展DT框架的体系结构,基于预测编码进行条件化,使决策能够基于过去和未来因素,从而提高泛化能力。通过在AntMaze和FrankaKitchen环境中的八个数据集上进行大量实验,我们的方法在离线目标导向RL中实现了与现有流行价值基和转换器基方法相当或更好的性能。此外,我们还在一个具身机器人目标到达任务上评估了该方法。
引用
@article{arxiv.2410.03408,
title = {Predictive Coding for Decision Transformer},
author = {Tung M. Luu and Donghoon Lee and Chang D. Yoo},
journal= {arXiv preprint arXiv:2410.03408},
year = {2025}
}
备注
8 pages, IROS 2024. The first two authors are equally contributed (Code: https://github.com/tunglm2203/pcdt)