中文

层次化提示决策变换器:通过全局与自适应引导提升零样多样性策略泛化

机器学习 2024-12-16 v2

摘要

决策变换器将强化学习重新诠释为条件序列生成问题,这为传统基于价值或策略的方法提供了一个简单而有效的替代方案。该领域的最新关键发展是将提示集成到决策变换器中,以促进零样策略泛化。然而,当前方法主要使用静态提示片段来指导 rollouts,这限制了其提供特定上下文指导的能力。为此,我们引入一种由检索增强支持的层次化提示方法。该方法学习两个层次的软标记作为引导提示:(1) 封装轨迹级任务信息的全局标记;(2) 为特定时间步提供聚焦指令的自适应标记。自适应标记从精选的演示片段集合中动态检索,以确保上下文感知的指导。实验在 MuJoCo 和 MetaWorld 环境中的七个基准任务中表明,所提出的方法持续优于所有基线方法,表明层次化提示对决策变换器是实现零样策略泛化的有效策略。

关键词

引用

@article{arxiv.2412.00979,
  title  = {Hierarchical Prompt Decision Transformer: Improving Few-Shot Policy Generalization with Global and Adaptive Guidance},
  author = {Zhe Wang and Haozhu Wang and Yanjun Qi},
  journal= {arXiv preprint arXiv:2412.00979},
  year   = {2024}
}