中文

后继特征表示

机器学习 2023-08-03 v4 人工智能

摘要

强化学习中的迁移旨在利用来自已经历源任务的知识来改善目标任务上的学习性能。后继表示(SR)及其扩展后继特征(SF)是在任务间奖励函数变化的领域中的重要迁移机制。它们重新评估先前学习策略在新目标任务中的期望回报以迁移其知识。SF 框架通过将以线性方式将奖励分解为后继特征与奖励权重向量扩展了 SR,使其可应用于高维任务。但这是以奖励函数与后继特征之间呈线性关系为代价,限制了其仅能应用于存在此类线性关系的任务。我们提出了一种基于学习后继特征的累积折扣概率的 SR 新公式,称为后继特征表示(SFR)。关键在于,SFR 允许对一般奖励函数的策略期望回报进行重新评估。我们引入了不同的 SFR 变体,证明其收敛性,并给出其迁移性能的保证。基于带函数近似的 SFR 的实验评估展示了其相对于 SF 的优势,不仅针对一般奖励函数,在线性可分解奖励函数情形下亦如此。

关键词

引用

@article{arxiv.2110.15701,
  title  = {Successor Feature Representations},
  author = {Chris Reinke and Xavier Alameda-Pineda},
  journal= {arXiv preprint arXiv:2110.15701},
  year   = {2023}
}

备注

published in Transactions on Machine Learning Research (05/2023), source code: https://gitlab.inria.fr/robotlearn/sfr_learning, [v2] added experiments with learned features, [v3] renamed paper and changed scope, [v4] published version