中文

面向时间序列的深度强化学习:玩理想化交易博弈

机器学习 2018-03-13 v1 机器学习

摘要

本文研究将 Deep Q-learning 作为端到端方案,用于估计对时间序列输入采取行动的最优策略。实验在两个理想化交易博弈上进行。1)单变量:唯一输入为波状价格时间序列;2)双变量:输入包含一个随机阶跃价格时间序列和一个与未来价格变化正相关的带噪信号时间序列。单变量博弈测试智能体能否捕捉底层动态,双变量博弈测试智能体能否利用输入间的隐藏关系。采用堆叠门控循环单元(GRU)、长短期记忆(LSTM)单元、卷积神经网络(CNN)和多层感知机(MLP)对 Q 值建模。两种博弈中所有智能体均成功找到盈利策略。基于 GRU 的智能体在单变量博弈中总体表现最佳,而基于 MLP 的智能体在双变量博弈中优于其他模型。

关键词

引用

@article{arxiv.1803.03916,
  title  = {Deep reinforcement learning for time series: playing idealized trading games},
  author = {Xiang Gao},
  journal= {arXiv preprint arXiv:1803.03916},
  year   = {2018}
}