中文

软动作先验:迈向鲁棒的策略迁移

机器学习 2022-09-21 v1 人工智能

摘要

尽管在诸多挑战性问题中取得了成功,强化学习(RL)仍面临样本效率低下的困境,而引入先验知识给智能体可缓解该问题。然而,许多强化学习中的迁移技术做出了限制性假设,即教师为专家。本文利用“强化学习即推断”框架中的动作先验——即每个状态下类似于教师策略的动作分布,而非贝叶斯先验——来恢复最先进的策略蒸馏技术。随后,我们提出一类自适应方法,通过结合奖励塑形与辅助正则化损失,能够鲁棒地利用动作先验。与先前工作不同,我们开发了利用次优动作先验的算法,此类先验虽次优但仍可传授有价值的知识——我们称之为软动作先验。所提算法通过依据对各状态下教师有用性的估计来调整教师反馈的强度,从而实现自适应。我们进行了表格实验,结果表明所提方法达到了最先进的性能,并在从次优先验中学习时超越该性能。最后,我们在连续动作深度RL问题中展示了自适应算法的鲁棒性,与现有策略蒸馏方法相比,自适应算法显著提升了稳定性。

关键词

引用

@article{arxiv.2209.09882,
  title  = {Soft Action Priors: Towards Robust Policy Transfer},
  author = {Matheus Centa and Philippe Preux},
  journal= {arXiv preprint arXiv:2209.09882},
  year   = {2022}
}

备注

Preprint