中文

EASpace:用于策略迁移的增强动作空间

系统与控制 2023-07-26 v2 机器人学 系统与控制

摘要

将专家策略表述为宏动作有望通过结构化探索与高效信用分配缓解长视野问题。然而,传统的基于选项的多种策略迁移方法存在宏动作时长探索效率低、对有用的长时长宏动作利用不足的问题。本文提出一种名为 EASpace(增强动作空间)的新算法,其以替代形式表述宏动作,利用多个可用的次优专家策略加速学习过程。具体而言,EASpace 将每个专家策略表述为具有不同执行{次数}的多个宏动作。所有宏动作随后直接整合进原始动作空间。引入与宏动作执行时间成正比的内在奖励,以鼓励对有用的宏动作进行利用。采用类似于 Intra-option Q-learning 的相应学习规则来提高数据效率。理论分析表明所提学习规则的收敛性。EASpace 的效率通过基于网格的游戏和多智能体追捕问题加以说明,所提算法也在物理系统中实现以验证其有效性。

关键词

引用

@article{arxiv.2212.03540,
  title  = {EASpace: Enhanced Action Space for Policy Transfer},
  author = {Zheng Zhang and Qingrui Zhang and Bo Zhu and Xiaohan Wang and Tianjiang Hu},
  journal= {arXiv preprint arXiv:2212.03540},
  year   = {2023}
}

备注

15 Pages