中文

无模型风险敏感强化学习

机器学习 2021-11-05 v1

摘要

我们扩展了时间差分 (TD) 学习,以获得风险敏感的无模型强化学习算法。这种扩展可以被视为对 Rescorla-Wagner 规则的修改,其中(S 型)刺激被取作高估或低估 TD 目标的事件。结果,得到了一个随机近似规则,用于从由具有未知均值和方差的高斯分布生成的独立同分布 (i.i.d.) 样本中估计自由能。由于已知高斯自由能是对均值和方差敏感的确定性等价物,该学习规则在风险敏感决策中具有应用。

关键词

引用

@article{arxiv.2111.02907,
  title  = {Model-Free Risk-Sensitive Reinforcement Learning},
  author = {Grégoire Delétang and Jordi Grau-Moya and Markus Kunesch and Tim Genewein and Rob Brekelmans and Shane Legg and Pedro A. Ortega},
  journal= {arXiv preprint arXiv:2111.02907},
  year   = {2021}
}

备注

DeepMind Tech Report: 13 pages, 4 figures