中文

基于专家轨迹强化学习的量化交易

机器学习 2021-05-11 v1 人工智能 交易与市场微观结构

摘要

近年来,结合人工智能的量化投资方法吸引了越来越多投资者与研究者的关注。现有基于监督学习的相关方法不太适用于真实期货交易中具长期目标与延迟奖励的学习问题。因此,本文将价格预测问题建模为马尔可夫决策过程(MDP),并通过带专家轨迹的强化学习对其进行优化。在所提方法中,我们使用逾 100 个短期 alpha 因子而非现有方法所用的价格、成交量及若干技术因子来描述 MDP 的状态。此外,不同于相关方法中的 DQN(深度 Q 学习)与 BC(行为克隆),我们在训练阶段引入专家经验,并同时考虑专家-环境交互与智能体-环境交互来设计时序差分误差,从而使智能体对金融数据中不可避免的噪声更具适应性。在中国股指期货(包括 IF(沪深 300)与 IC(中证 500))上的实验结果表明,相较三种典型技术分析与两种基于深度学习的方法,所提方法具有优势。

关键词

引用

@article{arxiv.2105.03844,
  title  = {Reinforcement Learning with Expert Trajectory For Quantitative Trading},
  author = {Sihang Chen and Weiqi Luo and Chao Yu},
  journal= {arXiv preprint arXiv:2105.03844},
  year   = {2021}
}