无模型风险敏感强化学习
机器学习
2021-11-05 v1
摘要
我们扩展了时间差分 (TD) 学习,以获得风险敏感的无模型强化学习算法。这种扩展可以被视为对 Rescorla-Wagner 规则的修改,其中(S 型)刺激被取作高估或低估 TD 目标的事件。结果,得到了一个随机近似规则,用于从由具有未知均值和方差的高斯分布生成的独立同分布 (i.i.d.) 样本中估计自由能。由于已知高斯自由能是对均值和方差敏感的确定性等价物,该学习规则在风险敏感决策中具有应用。
引用
@article{arxiv.2111.02907,
title = {Model-Free Risk-Sensitive Reinforcement Learning},
author = {Grégoire Delétang and Jordi Grau-Moya and Markus Kunesch and Tim Genewein and Rob Brekelmans and Shane Legg and Pedro A. Ortega},
journal= {arXiv preprint arXiv:2111.02907},
year = {2021}
}
备注
DeepMind Tech Report: 13 pages, 4 figures