中文

基于强化学习解决市场做市中的延迟与库存风险

机器学习 2025-05-20 v1

摘要

交易所的延迟在市场做市 (Market Making, MM) 中是不可避免的,这源于硬件限制、系统处理时间、接收交易所数据延迟、订单传输至市场所需时间等因素。现有做市的强化学习 (RL) 方法忽略了这些延迟影响,可能导致因决策时刻与执行时刻之间的价格差异而产生意外的订单取消,进而导致库存积累,暴露做市商于 increased 市场风险。因此,这些方法无法在真实的 MM 场景中应用。为解决这些问题,本文首先构建了一个包含 30-100 毫秒订单下达和市场信息接收随机延迟的真实 MM 环境,并实现批处理匹配机制——在每个 500 毫秒的窗口内收集订单,随后一次性完成匹配,模拟部分交易所采用的批处理拍卖机制。随后,我们提出 Relaver,一种针对 MM 的 RL 方法以解决延迟和库存风险问题。Relaver 的三个主要贡献:i) 引入增强状态-动作空间,将订单保持时间纳入价格和 volume 之外,使 Relaver 能够在延迟约束和时间优先匹配机制下优化执行策略;ii) 利用动态编程 (DP) 指导 RL 训练以获得更优策略;iii) 训练市场趋势预测器,引导智能体调整库存以降低风险。广泛的实验和消融研究在四个真实世界数据集上表明,\textsc{Relaver} 在多个指标上显著提升了当前基于 RL 的 MM 策略性能。

引用

@article{arxiv.2505.12465,
  title  = {Resolving Latency and Inventory Risk in Market Making with Reinforcement Learning},
  author = {Junzhe Jiang and Chang Yang and Xinrun Wang and Zhiming Li and Xiao Huang and Bo Li},
  journal= {arXiv preprint arXiv:2505.12465},
  year   = {2025}
}