QT-TDM:基于Transformer动态模型和自回归Q学习的规划
机器学习
2024-11-19 v2
摘要
受Transformer架构在自然语言处理和计算机视觉中成功应用的启发,我们探讨了在强化学习(RL)中使用Transformer,特别是用于建模环境动态的Transformer动态模型(TDM)。我们评估了TDM在以Model Predictive Control(MPC)进行实时规划场景中的连续控制能力。虽然Transformer在长程预测方面表现出色,但其分词机制和自回归特性会导致在长时间范围内进行规划时计算成本高昂,尤其当环境维度增加时。为缓解这一问题,我们使用TDM进行短期规划,并通过独立的Q-Transformer(QT)模型学习自回归离散Q函数,以估计超出短期规划范围的长期回报。我们提出的方法QT-TDM将Transformer作为动态模型的稳健预测能力与模型无Q-Transformer的有效性相结合,以减轻实时规划所需的计算负担。在多样化的基于状态的连续控制任务上的实验表明,QT-TDM在性能和样本效率方面优于现有的基于Transformer的强化学习模型,同时实现了快速且计算效率高的推理。
引用
@article{arxiv.2407.18841,
title = {QT-TDM: Planning With Transformer Dynamics Model and Autoregressive Q-Learning},
author = {Mostafa Kotb and Cornelius Weber and Muhammad Burhan Hafez and Stefan Wermter},
journal= {arXiv preprint arXiv:2407.18841},
year = {2024}
}
备注
Accepted by IEEE Robotics and Automation Letters (RA-L)