中文

一种用于价值学习的广义自助目标:高效结合价值与特征预测

机器学习 2022-01-07 v1 人工智能

摘要

估计价值函数是强化学习算法的核心组成部分。时序差分(TD)学习算法使用自助法,即它们利用后续时间步的价值估计将价值函数更新至一个学习目标。或者,价值函数可更新至由单独预测后继特征(SF)——一种策略相关模型——并将其与即时奖励线性组合所构建的学习目标。我们关注估计价值函数时使用的自助目标,并提出一种新的备份目标,即 η\eta-回报混合,其隐式地将价值预测知识(TD 方法所用)与(后继)特征预测知识相结合——由参数 η\eta 捕获对各自的依赖程度。我们阐明,通过 ηγ\eta\gamma-折扣 SF 模型引入预测知识,相比两种极端情况(即完全基于价值函数估计自助,或基于单独估计的后继特征与即时奖励模型之积自助)能更高效利用采样经验。我们通过实证表明,该方法在表格和非线性函数逼近下均带来更快的策略评估和更好的控制性能,显示出可扩展性与通用性。

关键词

引用

@article{arxiv.2201.01836,
  title  = {A Generalized Bootstrap Target for Value-Learning, Efficiently Combining Value and Feature Predictions},
  author = {Anthony GX-Chen and Veronica Chelu and Blake A. Richards and Joelle Pineau},
  journal= {arXiv preprint arXiv:2201.01836},
  year   = {2022}
}

备注

18 pages, 6 figures, 2 tables. Preprint. Accepted by AAAI-22