多目标奖励泛化:提升深度强化学习在单资产交易应用中的性能
机器学习
2023-02-20 v2 计算金融
交易与市场微观结构
摘要
我们研究了多目标深度强化学习在股票与加密货币单资产交易中的潜力:特别地,我们考虑一种将奖励函数与折扣因子泛化的多目标算法(即这些组件并非先验指定,而是纳入学习过程)。首先,使用若干重要资产(加密货币对 BTCUSD、ETHUSDT、XRPUSDT,以及股票指数 AAPL、SPY、NIFTY50),我们验证了所提多目标算法的奖励泛化性质,并提供初步统计证据显示其相较对应单目标策略具有更高的预测稳定性。其次,我们表明当奖励机制稀疏时(即非空反馈随时间稀少),多目标算法相较对应单目标策略具有明显优势。最后,我们讨论了关于折扣因子的泛化性质。我们的全部代码以开源形式提供。
引用
@article{arxiv.2203.04579,
title = {Multi-Objective reward generalization: Improving performance of Deep Reinforcement Learning for applications in single-asset trading},
author = {Federico Cornalba and Constantin Disselkamp and Davide Scassola and Christopher Helf},
journal= {arXiv preprint arXiv:2203.04579},
year = {2023}
}
备注
13 pages, 20 figures