中文

基于集成的离策略奖励塑造

人工智能 2015-03-24 v2

摘要

基于潜力的奖励塑造(PBRS)是一种通过利用领域知识来加速强化学习的有效且流行技术。尽管已证明PBRS始终保留最优策略,但其对学习速度的影响由势函数的质量决定,而势函数质量又取决于底层启发式与尺度。知晓哪种启发式有效需事先测试选项,确定适当尺度需调参,二者均引入额外样本复杂度。我们提出了一种PBRS框架,其减少学习速度,但不产生额外样本复杂度。为此,我们提议同时学习策略的集成,这些策略针对多种启发式并在一系列尺度上被塑造。目标策略随后通过投票获得。该集成需能够高效可靠地离策略学习:近期Horde架构满足了这些要求,我们以其为基础。我们通过实证证明:(1)我们的集成策略优于基础策略及其单一启发式组件;(2)在通用尺度范围上的集成表现至少与具有最优调参组件的集成一样好。

关键词

引用

@article{arxiv.1502.03248,
  title  = {Off-Policy Reward Shaping with Ensembles},
  author = {Anna Harutyunyan and Tim Brys and Peter Vrancx and Ann Nowe},
  journal= {arXiv preprint arXiv:1502.03248},
  year   = {2015}
}

备注

To be presented at ALA-15. Short version to appear at AAMAS-15