In-Context决策变换器:基于层次链式思维的强化学习
机器学习
2024-06-03 v1 人工智能
摘要
In-context学习是离线强化学习(RL)处理在线任务的有前景方法,可通过提供任务提示来实现。最近的工作表明, treating RL任务作为跨episodic顺序预测问题时,in-context RL可以在试错中实现自我改进。尽管无需梯度更新的自我改进,但当前工作仍因跨episodic序列随任务时域增加而面临高计算成本。为此,我们提出In-Context决策变换器(IDT)以高效的方式实现自我改进。具体而言,IDT受人类决策中有效的层次结构启发,重构序列由高层决策而非与环境交互的低层动作组成。由于一个高层决策可以指导多步低层动作,IDT自然避免了过长的序列,更高效地解决了在线任务。实验结果表明,IDT在当前in-context RL方法中实现了长期任务的最先进水平。特别地,我们的方法在D4RL基准测试中的在线评估速度比基线快了36倍,在网格世界基准测试中快了27倍。
关键词
引用
@article{arxiv.2405.20692,
title = {In-Context Decision Transformer: Reinforcement Learning via Hierarchical Chain-of-Thought},
author = {Sili Huang and Jifeng Hu and Hechang Chen and Lichao Sun and Bo Yang},
journal= {arXiv preprint arXiv:2405.20692},
year = {2024}
}