采用非指数折扣的强化学习
机器学习
2022-12-08 v2 系统与控制
系统与控制
神经元与认知
机器学习
摘要
通常在强化学习(RL)中,奖励随时间以指数函数折扣来建模时间偏好,从而界定期望长期奖励。相反,在经济学与心理学中,已表明人类常采用双曲折扣方案,该方案在假设特定任务终止时间分布时是最优的。本工作中,我们提出一种推广至任意折扣函数的连续时间基于模型的强化学习理论。该表述涵盖了存在非指数随机终止时间的情况。我们推导了刻画最优策略的 Hamilton-Jacobi-Bellman (HJB) 方程,并描述了如何使用配置法求解,其中利用深度学习进行函数逼近。进一步,我们展示了如何处理逆 RL 问题,即试图从决策数据中恢复折扣函数的性质。我们在两个模拟问题上验证了所提方法的适用性。我们的方法为分析序贯决策任务中的人类折扣开辟了道路。
引用
@article{arxiv.2209.13413,
title = {Reinforcement Learning with Non-Exponential Discounting},
author = {Matthias Schultheis and Constantin A. Rothkopf and Heinz Koeppl},
journal= {arXiv preprint arXiv:2209.13413},
year = {2022}
}
备注
22 pages, 3 figures, published at 36th Conference on Neural Information Processing Systems (NeurIPS 2022)