中文

ASPiRe:面向强化学习的自适应技能先验

机器学习 2022-10-03 v1 人工智能

摘要

我们提出ASPiRe(Adaptive Skill Prior for RL,用于强化学习的自适应技能先验),一种利用先验经验加速强化学习的新方法。不同于现有方法从大型多样数据集中学习单一技能先验,我们的框架从一组专门化数据集中学习不同的区分性技能先验(即行为先验)库,并学习如何组合它们以解决新任务。该形式使算法能获取一组对下游任务更具复用性的专门化技能先验;然而,它也带来了如何有效组合这些非结构化技能先验集合以形成新任务新先验的额外挑战。具体而言,它要求智能体不仅识别使用哪些技能先验,还要确定如何组合它们(顺序或并行)以形成新先验。为实现该目标,ASPiRe包含自适应权重模块(AWM),其学习推断不同技能先验间的自适应权重分配,并通过加权Kullback-Leibler散度将它们用于指导下游任务的策略学习。我们的实验表明,在存在多个先验时ASPiRe能显著加速新下游任务的学习,并相对有竞争力的基线取得提升。

关键词

引用

@article{arxiv.2209.15205,
  title  = {ASPiRe:Adaptive Skill Priors for Reinforcement Learning},
  author = {Mengda Xu and Manuela Veloso and Shuran Song},
  journal= {arXiv preprint arXiv:2209.15205},
  year   = {2022}
}

备注

36th Conference on Neural Information Processing Systems (NeurIPS 2022)