连续时间VWAP目标执行的两类学习算法
最优化与控制
2024-11-12 v1
摘要
最优执行问题一直是持续受到关注的研究课题,许多强化学习算法已被研究。本文考虑成交量加权平均价格(VWAP)目标执行问题,提出了一种带熵正则化的松弛随机优化问题以鼓励更多探索。我们推导了最优策略的显式公式,该公式服从高斯分布,其均值即为原问题的解。将连续强化学习框架扩展到含跳跃的过程,我们为强化学习算法提供了一些理论证明。首先,最小化鞅损失函数在均方意义下导出了最优参数估计;其次,第二个算法利用鞅正交条件。除了强化学习算法外,我们还提出了另一种学习算法:自适应动态规划(ADP)算法,并在两种不同环境中、不同随机种子下验证了两者的性能。所有算法的收敛性已在不同环境中得到验证,并在价格冲击更强的环境中显示出更大优势。当智能体完全了解环境并能良好估计参数时,ADP是一个好的选择。另一方面,强化学习算法不需要任何模型假设或参数估计,能够直接从与环境的交互中学习。
引用
@article{arxiv.2411.06645,
title = {Two Kinds of Learning Algorithms for Continuous-Time VWAP Targeting Execution},
author = {Xingyu Zhou and Wenbin Chen and Mingyu Xu},
journal= {arXiv preprint arXiv:2411.06645},
year = {2024}
}