先模仿后超越:基于双窗口去噪PPO的多智能体最优执行
机器学习
2022-06-23 v1 人工智能
计算金融
交易与市场微观结构
摘要
提出了一种利用带模仿的强化学习(RL)求解最优执行与挂单问题的新框架。由该框架训练的RL智能体在执行成本上持续优于行业基准时间加权平均价格(TWAP)策略,并在样本外交易日期与股票代码上展现出良好的泛化能力。这一出色性能源于三个方面。首先,我们称为双窗口去噪PPO的RL网络架构能够在噪声市场环境中高效学习。其次,设计了带模仿学习的奖励方案,并研究了一组全面的市场特征。第三,我们灵活的动作表述使RL智能体能够协同处理最优执行与挂单,从而比单独求解各问题获得更优性能。RL智能体的性能在我们的多智能体真实历史限价订单簿模拟器中评估,其中价格冲击被精确度量。此外,还进行了消融研究,证实了框架的优越性。
引用
@article{arxiv.2206.10736,
title = {Imitate then Transcend: Multi-Agent Optimal Execution with Dual-Window Denoise PPO},
author = {Jin Fang and Jiacheng Weng and Yi Xiang and Xinwen Zhang},
journal= {arXiv preprint arXiv:2206.10736},
year = {2022}
}