QLBS Q学习器进阶NuQLear:拟合Q迭代、逆强化学习与期权组合
计算金融
2018-01-19 v1 机器学习
摘要
QLBS 模型是一种基于动态规划(DP)和强化学习(RL)的离散时间期权对冲与定价模型。它将著名的 Q-Learning 强化学习方法与 Black-Scholes(-Merton) 模型的思想相结合,即将期权定价与对冲问题化简为对该期权由股票和现金构成的动态复制组合进行最优再平衡的问题。在此我们围绕 QLBS 模型拓展若干 NuQLear(数值 Q-Learning) 主题。首先,我们研究拟合 Q 迭代(Fitted Q Iteration)作为该模型的 RL(数据驱动)解法的表现,并将其与 DP(基于模型)解法以及 BSM 模型进行基准比较。其次,我们为该模型建立逆强化学习(IRL)设定,其中仅观测交易者采取的价格与动作(再对冲),而不观测奖励。第三,我们概述如何将 QLBS 模型用于期权组合的定价,而非孤立地定价单一期权,从而针对 Black-Scholes 模型臭名昭著的波动率微笑问题提供其自身的数据驱动且模型无关的解法。
引用
@article{arxiv.1801.06077,
title = {The QLBS Q-Learner Goes NuQLear: Fitted Q Iteration, Inverse RL, and Option Portfolios},
author = {Igor Halperin},
journal= {arXiv preprint arXiv:1801.06077},
year = {2018}
}
备注
18 pages, 5 figures