DODT:通过Dreamer的Actor-Critic轨迹预测增强在线决策Transformer学习
机器学习
2024-10-16 v1 机器人学
机器学习
摘要
强化学习的进展导致了能够学习复杂决策任务的高级模型的开发。然而,高效地将世界模型与决策Transformer集成仍然是一个挑战。本文提出了一种新方法,将Dreamer算法生成的anticipatory轨迹与Online Decision Transformer的自适应学习能力相结合。我们的 методology使能够进行并行训练,Dreamer生成的轨迹增强Transformer的上下文决策,形成双向增强循环。我们在一套具有挑战性的基准测试上经验性地证明了我们方法的有效性,实现了对现有方法在样本效率和奖励最大化方面的显著改进。我们的結果表明,所提出的集成框架不仅加速学习,也在多样化且动态的场景中表现出鲁棒性,标志着模型基强化学习的重要进步。
关键词
引用
@article{arxiv.2410.11359,
title = {DODT: Enhanced Online Decision Transformer Learning through Dreamer's Actor-Critic Trajectory Forecasting},
author = {Eric Hanchen Jiang and Zhi Zhang and Dinghuai Zhang and Andrew Lizarraga and Chenheng Xu and Yasi Zhang and Siyan Zhao and Zhengjie Xu and Peiyu Yu and Yuer Tang and Deqian Kong and Ying Nian Wu},
journal= {arXiv preprint arXiv:2410.11359},
year = {2024}
}