中文

面向时间不一致问题的子博弈完美均衡强化学习方法

机器学习 2021-10-28 v1 计算机科学与博弈论 系统与控制 系统与控制 最优化与控制

摘要

本文针对时间不一致(TIC)问题建立子博弈完美均衡强化学习(SPERL)框架。在强化学习(RL)背景下,TIC 问题已知面临两个主要挑战:不同时间点价值函数之间自然递归关系的缺失,以及贝尔曼最优性原理的违背,这引发了对标准策略迭代算法适用性的质疑,因其策略改进定理无法证明。我们适配一种扩展动态规划理论,提出一类称为反向策略迭代(BPI)的新算法,可求解 SPERL 并应对上述两个挑战。为展示 BPI 作为训练框架的实际用途,我们适配标准 RL 仿真方法并推导两种基于 BPI 的训练算法。我们在一个均值-方差投资组合选择问题上检验所推导的训练框架,并评估包括收敛性与模型可辨识性在内的若干性能指标。

关键词

引用

@article{arxiv.2110.14295,
  title  = {A Subgame Perfect Equilibrium Reinforcement Learning Approach to Time-inconsistent Problems},
  author = {Nixie S. Lesmana and Chi Seng Pun},
  journal= {arXiv preprint arXiv:2110.14295},
  year   = {2021}
}