中文

当AI交易代理相互竞争时:基于强化学习的市场做市的元订单遭遇不利选择

交易与市场微观结构 2025-11-03 v1 机器学习

摘要

我们研究中频交易代理遭遇机会主义高频交易者不利选择的机制。我们在Hawkes限价簿(LOB)模型中使用强化学习(RL),以复制高频市场做市商的行为。在与具有外生价格冲击假设的经典模型不同,Hawkes模型考虑内生价格冲击以及其他关键市场特性(Jain等人,2024a)。鉴于市场做市商为处理每个LOB事件而更新策略的现实不可行性,我们通过冲动控制强化学习框架(Jain等人,2025)构建了高频市场做市代理。所用RL采用近端策略优化(PPO)和自模仿学习。为复制不利选择现象,我们测试RL代理交易于执行元订单的中频交易者(MFT)。我们展示了在针对MFT元订单执行代理进行训练的情况下,RL市场做市代理学会利用由元订单引起的价格漂移所获利。最近的实证研究表明,中频交易者正日益遭遇高频交易代理的不利选择。随着高频交易在金融市场中继续扩散,中频交易者所承担的滑点成本可能会随时间增加。然而,我们观察到,尽管RL市场做市代理获得更多利润,未必导致MFT代理的滑点显著增加。

关键词

引用

@article{arxiv.2510.27334,
  title  = {When AI Trading Agents Compete: Adverse Selection of Meta-Orders by Reinforcement Learning-Based Market Making},
  author = {Ali Raza Jafree and Konark Jain and Nick Firoozye},
  journal= {arXiv preprint arXiv:2510.27334},
  year   = {2025}
}