CIM:面向稀疏奖励连续控制的约束内在动机
机器学习
2023-05-19 v2
摘要
内在动机是一种用于解决外部奖励稀疏或缺失的强化学习任务的有前景的探索技术。实现内在动机存在两个技术挑战:1) 如何设计一个合适的内在目标以促进高效探索;2) 如何将内在目标与外在目标结合以帮助找到更优解。在现有文献中,内在目标均以任务无关的方式设计,并通过简单加法与外在目标结合(或单独用于无奖励的预训练)。本工作表明,这些设计在典型的稀疏奖励连续控制任务中会失效。为解决该问题,我们提出了约束内在动机(CIM),利用易于获得的任务先验来构建一个受约束的内在目标,同时利用拉格朗日方法,通过一个同步最大化框架自适应地平衡内在与外在目标。我们在多个稀疏奖励连续控制任务上通过实验证明,我们的 CIM 方法相比最先进的方法,在性能和样本效率上均有显著提升。此外,CIM 的关键技术也可以嵌入到现有方法中以提升其性能。
引用
@article{arxiv.2211.15205,
title = {CIM: Constrained Intrinsic Motivation for Sparse-Reward Continuous Control},
author = {Xiang Zheng and Xingjun Ma and Cong Wang},
journal= {arXiv preprint arXiv:2211.15205},
year = {2023}
}
备注
This paper has been withdrawn by the author since it is not perfect enough