中文

EUCLID:面向高效无监督强化学习的多选动力学模型

机器学习 2023-02-23 v2 人工智能 机器人学

摘要

无监督强化学习(URL)提出了一种有前景的范式,可在无外在奖励引导的任务无关环境中学习有用行为,以促进各类下游任务的快速适配。以往工作聚焦于以无模型方式进行预训练,而缺乏对转移动力学建模的研究,这为提升下游任务的样本效率留下了很大空间。为此,我们提出一种带多选动力学模型的高效无监督强化学习框架(EUCLID),其引入一种新颖的模型融合范式,在预训练阶段联合预训练动力学模型与无监督探索策略,从而更好地利用环境样本并提升下游任务采样效率。然而,构建能捕捉不同行为下局部动力学的可泛化模型仍具挑战。我们引入多选动力学模型,并行覆盖不同行为下的不同局部动力学,其在无监督预训练中使用不同头(head)学习不同行为下的状态转移,并在下游任务中选择最合适的头进行预测。在操控与运动域中的实验结果表明,EUCLID以高样本效率取得了最先进的性能,基本解决了基于状态的URLB基准,并在100k微调步的下游任务中达到104.0±\pm1.2%\%的均值归一化分数,相当于DDPG在2M交互步、多20倍数据下的性能。

关键词

引用

@article{arxiv.2210.00498,
  title  = {EUCLID: Towards Efficient Unsupervised Reinforcement Learning with Multi-choice Dynamics Model},
  author = {Yifu Yuan and Jianye Hao and Fei Ni and Yao Mu and Yan Zheng and Yujing Hu and Jinyi Liu and Yingfeng Chen and Changjie Fan},
  journal= {arXiv preprint arXiv:2210.00498},
  year   = {2023}
}

备注

Published as a conference paper at ICLR 2023